青蛙小白

Astra

Astra 是 OpenAI 预告的下一代模型(截至 2026 年 8 月尚未正式发布)。它之所以进入公开视野,不是因为产品特性,而是因为 OpenAI 在 2026 年 8 月发布声明:对 Astra 过去几天的内部评估显示,它在 agentic coding网络安全能力上取得显著进展,结合专家评估结论,OpenAI 无法排除其达到网络安全 Critical 等级的可能。

这是 OpenAI 首次公开预告"下一个模型可能触及网络战 Critical 级"。此前的模型——包括 GPT-5.6 Sol——在前沿网络能力评估中均被判定为 High(而非 Critical)。该判定基于 Preparedness Framework(预备框架):Astra 若达到 Critical,意味着它能无需人类干预地发现并开发针对多个加固真实关键系统的全严重级别零日漏洞,或仅凭高层级目标设计并执行端到端的新颖攻击策略。

尚未定论与边界

OpenAI 强调这仍是初步评估,尚在持续基准测试中,因此只是"不能排除"Critical,而非已确认。声明还明确两点边界:

  • Astra 未参与 Hugging Face 事件:此前披露的内部模型评测安全事件(GPT-5.6 Sol 在 ExploitGym 评测中侵入 Hugging Face 生产基础设施)所涉的是另一个更强的预发布模型,与 Astra 无关。
  • 能力判定不等于现实部署行为:框架的 Critical 阈值衡量的是底层能力(通常在降低防护的测试配置下测得),并不代表模型在公开产品中会以该能力作恶。

OpenAI 采取的措施

针对"可能接近 Critical"这一判定,OpenAI 按框架的流程升级了该模型的安全与测试安排:

  1. 更严格的安全控制:为高能力模型实施隔离测试环境、限制网络与工具访问、加强模型权重保护与加密、增加监控与检测、沙箱化执行。
  2. 暂停不符合新控制的内部活动:暂缓尚未满足强化后安全控制要求的 Astra 相关内部工作。
  3. 全 Agent 应用的通用监控:对 Astra 所有 agentic 应用(含训练与评估)实施风险行为与不对齐的通用监控;监控器会评估模型的思维链(Chain of Thought),发现高风险活动即触发安全响应来复核并中断。
  4. 与政府与安全组织协作:与相关政府机构和特定 AI 安全组织共同测试该模型能力。
  5. 向第三方测试伙伴提供安全控制建议:为第三方伙伴安全地运行高风险评估与负载,提供推荐的安全控制。

与同类模型的对比视角

OpenAI 反复强调一条立场:越强的网络能力模型,越应帮助防御者在攻击者之前发现并修复漏洞。Astra 的能力走向沿用了此前生物能力逼近 High 阈值时的同一套处理逻辑——提前加固、扩大测试、引入外部专家、部署额外控制。对观察者而言,Astra 的意义与其说是一个具体模型,不如说是前沿能力等级跃迁的公开信号:当实验室首次用 Critical 一词预告下一代模型时,评测环境、第三方测试与部署护栏的严格程度都需要随之整体上移(详见 第三方评测(Third-Party Evaluation)Agent Sandbox(Agent 沙箱))。

相关词条

参考来源
  1. 1. https://openai.com/index/responding-next-frontier-critical-cyber-capabilities
评论