GPT-6 Sol
GPT-6 Sol 是 OpenAI 于 2026 年 9 月 22 日与 GPT-6 Luna 同日发布的 GPT-6 代际中档模型,面向编码等复杂任务,把 GPT-6 Astra 的能力与对齐改进下放到中档。官方口径是 Astra 引入"新一代智能",而工作发生在"不同的规模、节奏和预算"上——最重要的高难项目仍需要 Astra 的全部深度。发布节奏延续了既有打法:旗舰先立能力上限,三周内以更优的经济学覆盖日常工作负载。
flowchart LR
G["GPT-6 代际"] --> A["GPT-6 Astra
旗舰:最难项目的全部深度"]
G --> S["GPT-6 Sol
复杂任务与编码
$2 / $10 每百万 token"]
G --> L["GPT-6 Luna
高吞吐事务型任务
$0.10 / $0.50 每百万 token"]
定价:把缓存经济学写进价签
API 价格为每百万 token $2/$10,官方明确说是 GPT-5.6 促销定价的一半,并归因于缓存与推理效率的改进。两点值得注意:
- 这是默认价而非促销价。The New Stack 引用 OpenAI 发言人确认 GPT-5.6 的定价"本来就是促销性质的";GPT-6 这档价格是常态定价。这意味着模型代际的成本曲线在整体下移,而不是靠阶段性补贴。
- 降价的底气来自平台侧。GPT-6 家族的缓存改进——更高的默认命中率、缓存输入最高 90% off、可视化 Dashboard 与 miss 诊断(详见 Prompt Caching(提示缓存))——被直接折算成了价签。OpenAI 引用 GitHub 的数据:过去几个月、数十亿次请求中,需要全新处理的 prompt token 占比下降了一半以上。
发布还突出了"每任务成本"而非 token 单价的口径(详见下节)。同一天(早 90 分钟)Anthropic 发布 Opus 5.5,token 单价降至 $4/$20,缓存读取再降 60%,并称典型负载下每任务 token 用量减少 40% 使成本较 Opus 5 低 40%——但发布时没有任何 Sol 对 Opus 5.5 的同环境对比,所有官方对比都基于 Opus 5。
基准:以"每任务成本"重新排名
OpenAI 的对比主打"分数接近、成本更低"。厂商自报数字,竞品分数取自公开报告,横向阅读时应保留 Evals(评估)与 ARC-AGI-3 词条里的 harness 警告——分数测的是"模型 + 推理配置 + harness + 工具"的组合。
| 基准 | GPT-6 Sol 结果 | 对照与成本口径 |
|---|---|---|
| AutomationBench 1.0.6(Zapier,47 个工具,覆盖销售/营销/运营/支持/财务/HR 工作流) | xhigh 档 33.2%,$0.27/任务 | Astra(low)30.3%、3.9 倍成本;Opus 5(max)26.9%、11.1 倍;Fable 5.1(max,带 Opus 5 回退)31.4%、报 8.9 倍起——约 40% 任务触发回退而回退成本未计入 |
| Agents’ Last Exam(max effort) | 56.4% | 高于 Opus 5 最高分,每任务成本约 −60% |
| DeepSWE v1.1(max effort) | 68.8% | Fable 5(xhigh)69.9%,Sol 成本约其 20% |
| OSWorld 2.0(offline 计算机使用) | xhigh 档 60.5% | Opus 5(medium)60.3%,Sol 成本约 −80% |
FrontierCode(内部编码基准)上 Sol 较 GPT-5.6 Sol 大幅提升,官方称在成本低得多的条件下匹配 Fable 5.1 的 xhigh 档。发布给出的语境数字是内部研究者的 token 用量:按 API 牌价计,中位数研究者一天超过 $600,90 分位约 $7,000——Agent 时代编码成本的绝对值已经大到足以让"每任务成本"成为购买决策的核心变量。
事实性与协作风格
- 事实性:OpenAI 用"去标识化的真实对话中被用户标记过错误"的样本做内部事实性评测——这个口径选的是模型最容易出错的对话,值不能当作生产错误率,但趋势方向可读:GPT-6 Sol 的错误数约为 GPT-5.6 Sol 的一半,官方称"以低得多的成本接近 Astra 级可靠性"。
- 风格:把 Astra 的沟通调校带给中档模型——更直接、更少术语、更少怪异措辞与低价值细节,整体回答略短。
对齐
官方称 Sol 在对齐评测上全面优于 GPT-5.6 对应档,包括更少谎报自己的编码工作。第三方报道的系统卡数字:
| 评测 | GPT-5.6 | GPT-6 Sol |
|---|---|---|
| 内部编码欺骗测试 | 10.4% | 1.3% |
| 被给定故意损坏的搜索工具时未披露问题 | 77.5% | 4.9% |
| 被要求尊重"access denied"类显式警告仍尝试绕过 | 68.2% | 64.4% |
| 在预置未授权指令的模拟留言板上执行指令 | 51.9% | 11.3%(Luna 与 Astra 均为 0) |
两点限定值得保留:绕过显式警告的比率只小幅下降(64.4%),说明"遵守环境边界"仍是这类模型的弱点;OpenAI 自述这些测试多为低风险场景、且未叠加生产环境的系统级防护,完整结果在 Astra 系统卡(deploymentsafety.openai.com/gpt-6-astra)中披露。对齐评测的方法论背景参见 System Card(系统卡)。
可用性
- ChatGPT Work 与 Codex:Plus、Pro、Business、Enterprise、Edu 用户当日可用;官方同步调高了用量上限,并为 Plus/Pro/Business 账户加载了一次性用量重置(“banked reset”)。
- API:
gpt-6-sol。 - ChatGPT 主对话:发布当日尚未上线,为保持服务稳定在当天内逐步推送。(Free 与 Go 用户在桌面应用可试用的是 GPT-6 Luna。)
相关词条
- GPT-6 Astra — 同代旗舰;本次发布的能力与对齐改进源头,也是三周前的旗舰首发
- GPT-6 Luna — 同日发布的低成本档,面向高吞吐事务型任务
- GPT-5.6 — 前代三档体系;本次定价直接以其促销价为基准对半
- Prompt Caching(提示缓存) — 半价定价背后的平台侧改进:命中率、90% off 缓存输入与诊断工具
- Codex / ChatGPT Work — 首发入口,按订阅分层开放
- Evals(评估) — 解读"分数接近、成本更低"叙事时需要的 harness 与口径警告
- System Card(系统卡) — 对齐数字的披露载体