GLM-5.3
GLM-5.3 是智谱(z.ai)于 2026 年 8 月发布的开放权重大模型。它与 GLM-5.2 共用同一基座,全部增益来自 post-training 扩展;发布后约两周完成安全评估与加固后开放权重。它进入网络安全语境的原因,是网络安全能力在训练扩展中意外地快速涌现:GLM-5.3 成为 CyberGym 与 ExploitBench 上开源模型的 SOTA。OpenAI 在 The Defender’s Window(防御者之窗) 中正是以它为例,说明"开放权重模型 cyber 能力只落后闭源前沿几个月、可能显著加速威胁格局"。
技术栈与扩展
GLM-5.2 已搭好整套扩展栈:IndexShare(高效长上下文处理)、SAO(长时程任务的 RL)、slime(开源大规模异步训练框架,THUDM 维护)。GLM-5.3 在这套栈上继续扩展:更多环境、更多样化的任务、更多计算。训练环境从"编码练习"转向"真实的专业工作单元"——例如 ML 基础设施任务中,模型获得与工程师相同的环境(计算集群、存储、内部文档、代码库与实验结果),需要端到端定位瓶颈并交付可测量的加速。环境本身成为扩展瓶颈,z.ai 因此建设了端到端环境合成流水线(研究代理收集真实工作模式生成可运行长时程环境,法官代理验证可解性,验证器不经参考答案生成)。
涌现的 cyber 能力
z.ai 把漏洞发现数据与环境混入训练后,能力增长速度快于预期:模型不只是更会找孤立缺陷,而是开始跨多个利用阶段推理、形成完整利用链的连贯计划。厂商自报的三个 benchmark 结果:
| Benchmark | GLM-5.3 | GLM-5.2 | 对比:闭源前沿 |
|---|---|---|---|
| CyberGym(白盒源码 → 触发漏洞验证) | 84.5 | 77.2 | Mythos 5 83.8、GPT-5.6 Sol 83.6 |
| ExploitBench(真实漏洞深推理) | 54.4 | 24.4 | Mythos 5 78.0、GPT-5.6 Sol 76.5 |
| ExploitGym(2h / 6h 完成任务数) | 105 / 130 | 29 / 39 | Mythos 5 181 / 247 |
规律是:越往利用链上端(发现 → 验证 → 利用)走,相对 GLM-5.2 的提升越大,与闭源前沿的差距也越大——“能力增长最快的地方,正是我们最落后的地方”。注意这些数字为厂商自报、使用 Claude Code harness 与域名白名单等防作弊设置,应视为方向性证据(ExploitGym 口径)。
真实世界发现与披露
z.ai 自述自 GLM-5.2 起与多家国内安全团队合作,让模型对真实代码库做漏洞挖掘:经专家复核、筛选与去重后,2,436 个漏洞 / 269 个项目,其中 1,097 个中高严重度(Critical 107 / High 990 / Medium 1,286 / Low 53),横跨系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用与网络协议。最早漏洞源自 1981 年(平均潜伏 26.6 年才被发现)。披露进展由 Z.ai Security Disclosure Ledger(cvd.z.ai)持续公开——截至发布时 53 个已公开、2,383 个仍处于 embargo。
意义
GLM-5.3 是"开放权重模型 cyber 能力追赶节奏"的锚点:闭源前沿(如 GPT-5.6 / GPT-5.6-Cyber)走可信防御者受控发布,开放权重侧则按自己的节奏把能力扩散出去。同系列的 GLM-5.2 还是 Hugging Face 在 ExploitGym 评测事故取证中用来破解加密代理载荷的模型——开放权重模型在防御侧的用途同样真实。
相关词条
- The Defender’s Window(防御者之窗) — 威胁侧叙事的引用案例
- ExploitGym — 对比所用的利用能力 benchmark;同系列 GLM-5.2 曾用于其评测事故取证
- GPT-5.6 — 对比中的闭源旗舰
- GPT-5.6-Cyber — 闭源侧的网络专用模型
- Daybreak — 闭源侧的可信防御者分发计划