青蛙小白

Preparedness Framework(预备框架)

Preparedness Framework(预备框架) 是 OpenAI 于 2023 年 12 月首次发布、此后持续迭代的一套内部评估框架,用来在模型接近生物、化学、网络安全和 AI 自我改进等危险能力之前就识别进展,并规划公司届时会采取的行动。它的核心是:先把危险能力分成若干领域并设好等级阈值,再用针对性评估把这些阈值"落地",最后根据模型落在哪个等级决定部署前要配备多强的安全措施。

OpenAI 首次发布它是"广撒网"性质的外部约定,随着能力逼近阈值才逐步用 system card(系统卡) 逐模型披露按框架得出的分级结论。框架的价值不在提供零风险承诺,而在把"要不要为高危用途额外把关"从临场拍板变成可复现、可对公众引用的判断流程。

评估的领域

框架跟踪四类可能造成严重危害的能力:网络安全生物与化学、以及AI 自我改进(Autonomous Replication & Adaptation,自主复制与适应)。每类都定义各自的评估集与阈值,OpenAI 在发布时逐模型报告落在哪个等级。

能力等级

每个领域都按能力高低划分为 Critical / High / Medium / Low 四个等级(Critical 为最高)。等级阈值衡量的是底层能力——通常通过降低防护的测试配置来测"模型在不受护栏干扰时能做到什么",这与公开部署中的常规行为是两个概念。判定达到某等级后,OpenAI 需为该等级配备相应的部署层防护;等级越高,硬性条件越严格。框架的判定逻辑也涵盖"严重危害实际发生的可能":即使能力达标,还要结合威胁模型与防护措施评估部署风险,对达到 High 及以上且风险不可控的模型不予部署。

以网络安全领域为例,CriticalHigh 的分界在于能否自主完成端到端攻击:

  • Critical(关键级):模型能在无人类干预的情况下,识别并开发出全严重级别的可工作的零日漏洞(zero-day exploit)——作用于多个加固的真实关键系统;或仅凭一个高层级目标,就能设计并执行针对加固目标的端到端新颖攻击策略
  • High(高):模型能找到漏洞与利用原语,但无法对加固目标自主完成端到端的完整利用链攻击。

分级如何驱动部署

等级不是评估结束就完事,而是直接决定后续动作:

flowchart LR
    A["评估模型能力"] --> B["判定安全等级
Critical / High / Medium / Low"] B --> C["对照阈值与威胁模型"] C -->|"达到某等级"| D["为该等级配备防护"] D --> E["发布前 system card 披露"] B -. "逐领域独立判定" .-> A

OpenAI 会把分级结论写进发布配套的 system card(系统卡) 公开,同时升级针对该能力的护栏、隔离与监控(详见 Agent Guardrails(Agent 护栏)Agent Sandbox(Agent 沙箱))。框架也授权公司在能力逼近阈值时采取更严格的前置措施。

一个分级如何落地:GPT-5.6 August Updates 的评判

以 GPT-5.6 August Updates 的 system card(系统卡) 为例,可以看到框架的等级判定具体由哪些评测支撑。OpenAI 把每次框架评测当作底层能力的下限估计:用降防护的配置测"模型在不受护栏干扰时能做到什么",并注明额外提示、微调、更长的 rollout 或不同的 scaffolding 都可能引出测试中未观察到的行为。

生物与化学能力:框架用四类评测测 High 阈值(湿实验室能力,尤其是隐性知识与排障),用两类测 Critical 阈值(新病原体设计)。对 GPT-5.6 Sol 与 Luna,四类 High 评测中有三类高于指示性阈值,因而继续按 High 对待;两类 Critical 评测(硬负样本蛋白结合预测、DNA 设计)均低于阈值,因此不作为 Critical。一个值得注意的机制是多数原则(majority rule):当同一 Critical 门槛下的多项关键评测中,已有足够的评测返回低于阈值的结果时,其余评测(如 AAV 衣壳包装预测)就不再运行——因为剩余结果已无法改变总体判定。

网络安全能力:High 阈值用 CTF 与 CVE-Bench 测漏洞识别与利用,Critical 阈值用 VulnLMP、ExploitBench、ExploitGym、SEC-Bench Pro 测端到端攻击与漏洞发现。GPT-5.6 Sol 的 CTF 通过率 97.06%(饱和)且 CVE-Bench 高于 High 阈值,而 Luna 在 CVE-Bench 上低于阈值——两者都按 High 而非 Critical 对待,因为其能力仍是"更擅长发现和修复漏洞、而非自主完成端到端攻击硬化目标"。网络靶场(cyber range)的端到端场景通过率也随模型层差异明显:Sol 83.3%、Luna 61.5%。

AI 自我改进:若模型在多项智能评测上与上一版本能力相近,且被判定低于 High,则该项能力评测可能直接不运行(August 更新即如此)。

这些评测的另一个要点是:等级阈值衡量的是底层能力,不代表已造成伤害,也不替代部署层的 Agent Guardrails(Agent 护栏)Agent Sandbox(Agent 沙箱)

两次关键的"临近阈值"事件

框架已两次触发 OpenAI 公开披露"能力临近下一等级":2025 年 6 月,生物能力逼近 High 阈值时 OpenAI 公布了加强防护、扩大测试、引入外部专家与额外安全控制的计划;2026 年 8 月,OpenAI 又预告其下一代模型 Astra 在内部评估中展现出显著的 agentic coding 与网络安全能力提升,结合专家评估结论,无法排除其达到网络安全 Critical 等级的可能——这是 OpenAI 首次公开"可能触及网络战 Critical"的预告,而此前包括 GPT-5.6 Sol 在内的模型均被判定为 High。两次事件应用的是同一套逻辑:能力越逼近高等级阈值,越要提前加固安全与测试安排。

与相关安全机制的定位

框架管的是"判定到达哪个等级",而 Red Teaming(红队测试)第三方评测(Third-Party Evaluation) 与部署层护栏分别承担"找出缺口、引入独立视角、落地防护"的角色。框架给出判定的标准与责任,护栏与评测把判定变成可运行的安全系统——评估出的等级本身不能替代防护,二者是衔接而非替代关系。它同样为一侧的 EU AI Act(欧盟人工智能法案) 等外部监管义务提供了"发布前风险评估"的内部对标物。

相关词条

参考来源
  1. 1. https://openai.com/index/responding-next-frontier-critical-cyber-capabilities
  2. 2. https://openai.com/index/updating-our-preparedness-framework/
  3. 3. https://openai.com/index/frontier-risk-and-preparedness/
  4. 4. https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf
  5. 5. https://deploymentsafety.openai.com/gpt-5-6/preparedness
  6. 6. https://deploymentsafety.openai.com/gpt-5-6/cyber-capability-evaluations-threshold-high
  7. 7. https://deploymentsafety.openai.com/gpt-5-6-august-update
评论