青蛙小白

GPT-5.6-Cyber

GPT-5.6-Cyber 是 OpenAI 基于 GPT-5.6 Sol 训练的网络安全专用模型,通过 Daybreak Red 向经审批的防御者提供。它的目标有两层:在零日发现、利用链开发等专项任务上提高能力;并对若干高风险但双用途的网络请求显著降低拒答率,使授权安全研究不被通用护栏误伤。

它不是公开 ChatGPT / 默认 API 的替代模型,也不是“去掉所有安全训练的 Sol”。OpenAI 的定位是:在身份验证、用途限制、监控与运行时沙箱之上,为可信防御工作流提供更宽松、更专业的模型行为。系统卡与更完整的评测披露计划稍后发布。

与 Sol / Blue 的边界

生产环境中,GPT-5.6 Sol 会先经系统级安全栈筛查网络相关请求;这能防滥用,也会拦正当防御任务。Daybreak Blue 去掉这些系统级护栏,但 Sol 本身对高度双用途提示(如对生产系统渗透测试)仍常拒答。GPT-5.6-Cyber 则额外训练,进一步降低此类拒答并强化部分工作流。

OpenAI 用内部评测 Advanced Cybersecurity Completion Rate 比较“会不会认真完成”高级场景(利用链、认证绕过、提权等):

模型 / 配置完成率
GPT-5.6 Sol(系统级护栏)1.5%
GPT-5.6 Sol(Daybreak Blue)2.0%
GPT-5.5-Cyber(Daybreak Red)57.3%
GPT-5.6-Cyber(Daybreak Red)95.0%

示例对比(macOS Keychain / Chrome cookie 解密工具类请求):仅 GPT-5.6-Cyber 在 Daybreak Red 下给出可操作路径;Sol(含 Blue)与 GPT-5.5-Cyber 均拒答。这是厂商展示的拒答差异样例,不构成对任意请求的保证。

能力评测(厂商报告)

以下均为 OpenAI 内部或内部实现的 benchmark 结果,应视为方向性证据,不是独立复现结论。

ExploitGym

ExploitGym(已知漏洞 → 可工作利用、在受控环境达到任意代码执行)上,GPT-5.6-Cyber 优于 GPT-5.6 Sol 与 GPT-5.5-Cyber。OpenAI 注明评测使用新的内部实现,环境为安全加固、隔离,并对不对齐行为做严格监控——与 2026 年 7 月 Hugging Face 相关评测事故后的 containment 要求一致。文章明确:GPT-5.6-Cyber 未参与 Hugging Face 入侵

零日发现与严重度校准

内部数据集:给定开源仓库当前版本,要求生成最大影响的 PoC 与技术 write-up;按发现的严重度/影响、以及 write-up 的校准与质量打分。GPT-5.6-Cyber(Red)优于 GPT-5.6 Sol(Blue),归因于专项训练。

Vulnerability Discovery and Report Writing

开放式“在含已知漏洞的仓库中找漏洞”评测:按是否找到严重且可行动的问题、是否做出可工作 PoC、报告质量计分。GPT-5.6 Sol 与 GPT-5.6-Cyber 均优于 GPT-5.5-Cyber;但在该评测上 Cyber 弱于 Sol,OpenAI 归因于 Cyber 有时写出更短、细节更少的漏洞报告——能力特化不等于全面更强。

ExploitBench

将 V8 漏洞做成完整利用;比 ExploitGym 更难(更多防护如 V8 sandbox 仍开启,且给 Agent 的漏洞信息更少)。标准设定(最多 300 轮)下,GPT-5.6 Sol(Blue)更省 token 且表现最好;放宽到 600 轮后两者差距缩小。说明在某些长程 harness 下,通用旗舰仍可能胜过专用模型。

真实软件中的发现(披露中)

训练完成后,OpenAI 用 GPT-5.6-Cyber 研究若干真实项目,并走协调披露:

V8 / Chrome(CVE-2026-15903):发现两个此前未知的漏洞,可链式造成内存破坏并逃逸 V8 heap sandbox;经 Google 修复后编号为 CVE-2026-15903(高危)。机理概要:

  1. 优化编译器在值转整数时错误跳过安全检查,使未定义值变成异常大的数;
  2. 该数若作数组下标,编译器可能错误假定其在边界内并省略检查 → 越界读写(沙箱内任意读写原语);
  3. 再叠加第二个漏洞(JSPI 栈逃逸等)才能走向原生代码执行或浏览器沙箱下一阶段。
flowchart LR
    A["JIT 类型 / ToNumber
安全检查被错误跳过"] --> B["越界字符串 / 数组
沙箱内任意读写"] B --> C["JSPI 栈逃逸等
第二原语"] C --> D["原生代码执行
或浏览器沙箱下一阶段"]

其它(未全部公开具体产品名,正与 Daybreak 伙伴及开源社区协调修复)

  • 某流行移动操作系统:至少 5 个漏洞,含从不可信应用到本地提权的链路;
  • 某流行数据库:3 个严重漏洞,含远程代码执行路径;
  • 某流行操作系统内核:超过 400 个可导致提权的漏洞。

这些数字是 OpenAI 在协调披露过程中的自我报告,完整 CVE 列表与独立复现尚在进行中。

Preparedness 分级

Preparedness Framework(预备框架) 下,发布前评估结论为:GPT-5.6-Cyber 与 Sol 一样达到网络安全 High未达 Critical。专项任务上相对 Sol 有提升,但不足以跨过 Critical 阈值(Critical 要求能对多个加固真实关键系统自主完成全严重级别零日,或仅凭高层目标执行端到端新颖攻击策略)。对照:Astra 被公开预告“无法排除 Critical”,因此内部控制更严;Cyber 则进入 Daybreak Red 的受控防御通道。

使用边界

  • 仅经 Daybreak Red 审批通道;不是默认公开模型。
  • 仍应在隔离环境中运行,配合 Auto-review、范围权限与轨迹监控。
  • 更低拒答 + 更强利用能力 = 误用与 misalignment 风险同时上升;OpenAI 的论点是:把同等能力留给攻击者、却不给防御者,窗口只会更窄。

相关词条

参考来源
  1. 1. https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
  2. 2. https://openai.com/daybreak/
  3. 3. https://openai.com/index/gpt-5-6/
评论