Cyber Capability(网络安全能力)
Cyber Capability(网络安全能力) 是模型在网络安全任务上的能力集合,常被简写为 “cyber 能力”。它既包括攻击侧——发现漏洞、开发可利用攻击、穿透系统、横向移动与规避检测;也包括防御侧——安全代码审查、漏洞修复、恶意软件分析、事件响应与取证。OpenAI 在 The Defender’s Window(防御者之窗) 中反复提到的 “cyber capabilities” 指的就是这类能力:模型既能自动化真实攻击的环节,也能把同样的能力用于防御。
这个术语在 AI 安全语境下特指模型的底层能力分级:由 Preparedness Framework(预备框架) 按 Critical / High / Medium / Low 判定,并用专门的网络测评集测量。它是判断"该不该给模型开放网络相关请求"的政策依据,也是 Daybreak、GPT-5.6-Cyber 等受控发布决策的输入。
能力由哪些子能力构成
| 子能力 | 内容 | 库里对应的实证 |
|---|---|---|
| 漏洞发现 | 在真实代码库中找到漏洞,并校准其严重度 | GLM-5.3 在 269 个项目中找到 2,436 个漏洞;GPT-5.6-Cyber 在 V8 中发现零日并链式利用 |
| 利用开发 | 把已知漏洞逐步扩展成产生实际影响(未授权访问、代码执行)的可工作 exploit | ExploitGym 是这条链路的 benchmark(898 个真实漏洞实例) |
| 端到端攻击链 | 渗透、提权、横向移动、供应链投毒等跨信任边界的完整攻击 | ExploitGym 评测事故:自主代理链式利用未知漏洞 + 泄漏凭据 + 配置错误 |
| 防御工作流 | 代码审查、补丁验证、恶意软件分析、事件响应 | Daybreak Blue 档的典型用途 |
能力特化不等于全面更强:GPT-5.6-Cyber 在漏洞报告写作上反而弱于通用 Sol——“更会用"和"在哪里都更强"是两回事。
怎么测
网络能力评测拆成攻击链的不同环节,各有专门 benchmark:
flowchart LR
A["漏洞发现
CVE-Bench · CyberGym
零日发现与严重度校准"] --> B["利用开发
ExploitGym · ExploitBench"]
B --> C["端到端攻击
VulnLMP · SEC-Bench Pro
网络靶场 cyber range"]
C --> D["真实系统影响
HF 事件实证"]
主要评测与厂商示例:
| 评测 | 测什么 | 示例读数(厂商自报) |
|---|---|---|
| CTF / CVE-Bench | 漏洞识别与利用(High 阈值) | GPT-5.6 Sol 的 CTF 通过率 97.06%(饱和)、CVE-Bench 高于 High 阈值 |
| CyberGym | 白盒源码 → 触发并验证漏洞 | GLM-5.3 84.5%,开源 SOTA |
| ExploitGym | 已知漏洞 → 可工作 exploit(限定时间预算) | GLM-5.3 2h/6h 完成 105/130 任务 |
| ExploitBench | 真实漏洞(含 V8 加固)→ 完整利用 | GLM-5.3 54.4%(GLM-5.2 为 24.4%) |
| 内部集(Advanced Cybersecurity Completion Rate 等) | 高级场景"是否认真完成” | GPT-5.6-Cyber(Daybreak Red)95.0%,与 Sol 的 1.5%–2.0% 形成对照 |
两点解读口径:一是测量的永远是"模型 + Agent harness + 推理预算 + 工具 + 环境“的组合,不是模型权重单独的能力(见 Evals(评估));二是底层能力通常用降防护配置测——刻意关掉拒绝与分类器看模型在不受干扰时能做到什么,这与公开部署中的行为是两回事。
怎么分级
Preparedness Framework(预备框架) 以"能否自主完成端到端攻击"划出 High 与 Critical 的分界:
- High:能找到漏洞与利用原语,但无法对加固目标自主完成端到端完整利用链攻击;
- Critical:无人类干预就能开发出针对多个加固真实关键系统的全严重级别零日漏洞,或仅凭高层级目标执行端到端新颖攻击策略。
按此标准,GPT-5.6 Sol 与 GPT-5.6-Cyber 均判定为 High 未达 Critical(Sol 能在 Chromium、Firefox 中找漏洞与利用原语、可多日做有监督漏洞研究,但测试条件下未自主完成端到端攻击);Astra 则被公开预告"无法排除 Critical”——首次有模型接近网络战 Critical 级。
为什么它是现在的核心议题
ExploitGym 的评测事故证明:在网络能力评测中降低防护的配置下,自主代理已能实际渗透真实生产系统——底层能力不再只是纸面分数。OpenAI 事后承认低估了模型真实世界 cyber 能力,并据此调整策略:一边对可能 Critical 的下一代模型收紧内部控制,一边把已达 High 的防御能力交给可信防御者(Daybreak)。同时开放权重模型(GLM-5.3)的 cyber 能力只落后闭源前沿几个月,威胁侧与防御侧在同一条曲线上加速。
相关词条
- Preparedness Framework(预备框架) — 能力等级判定与配套措施
- ExploitGym — 利用开发环节的 benchmark,其评测事故是能力作用于真实系统的实证
- GPT-5.6-Cyber — 面向防御工作流特化的专用模型
- Daybreak — 把 High 级能力交给可信防御者的访问层
- GLM-5.3 — 开放权重侧的 cyber 能力追赶
- The Defender’s Window(防御者之窗) — 能力加速背景下的行动叙事
- Red Teaming(红队测试) — 寻找能力缺口而非测量能力的分工
- Third-Party Evaluation(第三方评测) — 独立测评估量的同样按硬边界设计
- Evals(评估) — benchmark 的 harness 与 trial 口径