GPT-5.6-Cyber
GPT-5.6-Cyber 是 OpenAI 基于 GPT-5.6 Sol 训练的网络安全专用模型,通过 Daybreak Red 向经审批的防御者提供。它的目标有两层:在零日发现、利用链开发等专项任务上提高能力;并对若干高风险但双用途的网络请求显著降低拒答率,使授权安全研究不被通用护栏误伤。
它不是公开 ChatGPT / 默认 API 的替代模型,也不是“去掉所有安全训练的 Sol”。OpenAI 的定位是:在身份验证、用途限制、监控与运行时沙箱之上,为可信防御工作流提供更宽松、更专业的模型行为。系统卡与更完整的评测披露计划稍后发布。
与 Sol / Blue 的边界
生产环境中,GPT-5.6 Sol 会先经系统级安全栈筛查网络相关请求;这能防滥用,也会拦正当防御任务。Daybreak Blue 去掉这些系统级护栏,但 Sol 本身对高度双用途提示(如对生产系统渗透测试)仍常拒答。GPT-5.6-Cyber 则额外训练,进一步降低此类拒答并强化部分工作流。
OpenAI 用内部评测 Advanced Cybersecurity Completion Rate 比较“会不会认真完成”高级场景(利用链、认证绕过、提权等):
| 模型 / 配置 | 完成率 |
|---|---|
| GPT-5.6 Sol(系统级护栏) | 1.5% |
| GPT-5.6 Sol(Daybreak Blue) | 2.0% |
| GPT-5.5-Cyber(Daybreak Red) | 57.3% |
| GPT-5.6-Cyber(Daybreak Red) | 95.0% |
示例对比(macOS Keychain / Chrome cookie 解密工具类请求):仅 GPT-5.6-Cyber 在 Daybreak Red 下给出可操作路径;Sol(含 Blue)与 GPT-5.5-Cyber 均拒答。这是厂商展示的拒答差异样例,不构成对任意请求的保证。
能力评测(厂商报告)
以下均为 OpenAI 内部或内部实现的 benchmark 结果,应视为方向性证据,不是独立复现结论。
ExploitGym
在 ExploitGym(已知漏洞 → 可工作利用、在受控环境达到任意代码执行)上,GPT-5.6-Cyber 优于 GPT-5.6 Sol 与 GPT-5.5-Cyber。OpenAI 注明评测使用新的内部实现,环境为安全加固、隔离,并对不对齐行为做严格监控——与 2026 年 7 月 Hugging Face 相关评测事故后的 containment 要求一致。文章明确:GPT-5.6-Cyber 未参与 Hugging Face 入侵。
零日发现与严重度校准
内部数据集:给定开源仓库当前版本,要求生成最大影响的 PoC 与技术 write-up;按发现的严重度/影响、以及 write-up 的校准与质量打分。GPT-5.6-Cyber(Red)优于 GPT-5.6 Sol(Blue),归因于专项训练。
Vulnerability Discovery and Report Writing
开放式“在含已知漏洞的仓库中找漏洞”评测:按是否找到严重且可行动的问题、是否做出可工作 PoC、报告质量计分。GPT-5.6 Sol 与 GPT-5.6-Cyber 均优于 GPT-5.5-Cyber;但在该评测上 Cyber 弱于 Sol,OpenAI 归因于 Cyber 有时写出更短、细节更少的漏洞报告——能力特化不等于全面更强。
ExploitBench
将 V8 漏洞做成完整利用;比 ExploitGym 更难(更多防护如 V8 sandbox 仍开启,且给 Agent 的漏洞信息更少)。标准设定(最多 300 轮)下,GPT-5.6 Sol(Blue)更省 token 且表现最好;放宽到 600 轮后两者差距缩小。说明在某些长程 harness 下,通用旗舰仍可能胜过专用模型。
真实软件中的发现(披露中)
训练完成后,OpenAI 用 GPT-5.6-Cyber 研究若干真实项目,并走协调披露:
V8 / Chrome(CVE-2026-15903):发现两个此前未知的漏洞,可链式造成内存破坏并逃逸 V8 heap sandbox;经 Google 修复后编号为 CVE-2026-15903(高危)。机理概要:
- 优化编译器在值转整数时错误跳过安全检查,使未定义值变成异常大的数;
- 该数若作数组下标,编译器可能错误假定其在边界内并省略检查 → 越界读写(沙箱内任意读写原语);
- 再叠加第二个漏洞(JSPI 栈逃逸等)才能走向原生代码执行或浏览器沙箱下一阶段。
flowchart LR
A["JIT 类型 / ToNumber
安全检查被错误跳过"] --> B["越界字符串 / 数组
沙箱内任意读写"]
B --> C["JSPI 栈逃逸等
第二原语"]
C --> D["原生代码执行
或浏览器沙箱下一阶段"]
其它(未全部公开具体产品名,正与 Daybreak 伙伴及开源社区协调修复):
- 某流行移动操作系统:至少 5 个漏洞,含从不可信应用到本地提权的链路;
- 某流行数据库:3 个严重漏洞,含远程代码执行路径;
- 某流行操作系统内核:超过 400 个可导致提权的漏洞。
这些数字是 OpenAI 在协调披露过程中的自我报告,完整 CVE 列表与独立复现尚在进行中。
Preparedness 分级
在 Preparedness Framework(预备框架) 下,发布前评估结论为:GPT-5.6-Cyber 与 Sol 一样达到网络安全 High,未达 Critical。专项任务上相对 Sol 有提升,但不足以跨过 Critical 阈值(Critical 要求能对多个加固真实关键系统自主完成全严重级别零日,或仅凭高层目标执行端到端新颖攻击策略)。对照:Astra 被公开预告“无法排除 Critical”,因此内部控制更严;Cyber 则进入 Daybreak Red 的受控防御通道。
使用边界
- 仅经 Daybreak Red 审批通道;不是默认公开模型。
- 仍应在隔离环境中运行,配合 Auto-review、范围权限与轨迹监控。
- 更低拒答 + 更强利用能力 = 误用与 misalignment 风险同时上升;OpenAI 的论点是:把同等能力留给攻击者、却不给防御者,窗口只会更窄。
相关词条
- Daybreak — 承载 Blue / Red 访问与合作伙伴生态的计划
- GPT-5.6 — 基座旗舰 Sol 与通用安全栈
- Preparedness Framework(预备框架) — High / Critical 判定
- ExploitGym — 利用能力 benchmark
- Astra — 可能触及 Critical 的下一代模型
- Agent Guardrails(Agent 护栏) — 差异化访问与运行时防护
- Auto-review — 推荐的越界动作审查
- Codex — 常用 agentic 工作台