青蛙小白

HealthBench

HealthBench 是 OpenAI 用来评估模型在健康领域中能力与安全的一族评测。它回答的问题是:模型在面向普通消费者的健康对话中,能否既给出有用、又安全的回答。除基础版外还有 HealthBench Hard(更难的子集)、HealthBench Consensus(聚焦专家达成共识的题目)和 HealthBench Professional(面向真实临床医生场景、评估临床使用场景下的能力与安全)。

Chatbots 有潜力让消费者更好地理解自身健康状况,但健康回答的错误代价高,因此这类评测同时衡量"答得对不对"(能力)与"答得安不安全"(安全)。在 GPT-5.6 August Updates 的系统卡(System Card)中,它是安全与健康评估(Health)环节的核心指标。

逐变体定位

  • HealthBench:基础版,覆盖普通消费者健康话题的能力与安全。
  • HealthBench Hard:更难的子集,用于在能力上限附近拉开差距。
  • HealthBench Consensus:聚焦多位专家一致认可的题目,作为"公认正确"的稳健基线。
  • HealthBench Professional:使用真实临床医生对话,评估面向临床使用场景的能力与安全,是其专业版。

回答长度敏感性与长度调整评分

这是一个对 Evals(评估) 方法论有启发意义的细节:HealthBench 这类开放式对话评测会奖励更长的回答。长回答可能包含额外有价值的信息,但也会有更多机会满足评分标准里的正面条目;不必要的冗长回答对终端用户和临床医生反而更没用。因此,只看未调整分数会高估"更啰嗦"模型的真实可用性

为消除这一偏差,OpenAI 报告 HealthBench 分数时采用按回答长度调整(length-adjusted)的评分:先运行多个 OpenAI 模型在不同 verbosity 设置下,计算一个与回答长度成线性关系的经验调整量,再对最终回答长度做线性惩罚。以 2000 字符作为无调整的基准,更长的回答按每 500 字符扣分(各项取值不同,在 0–100 分尺度上):

评测每 500 字符罚分
HealthBench Professional1.47
HealthBench2.99
HealthBench Hard3.92
HealthBench Consensus0.20

更短的回答获得相应的正向调整。这套方法承认了"开放式回答评测的分数对长度敏感",提示任何这类评测(不只是健康)在比较不同模型时,都应报告长度调整后的分数,否则冗长而信息密度低的回答会虚高。

在 GPT-5.6 系列中的表现

在 GPT-5.6 August Updates 中,GPT-5.6 Sol 较 GPT-5.5 Instant 在 HealthBench Professional 提升最显著(+15.6),其次 HealthBench Hard(+8.5)、HealthBench(+3.6)、HealthBench Consensus(+0.8);四个子项未调整与调整后分数都改善,且多数回答更短。GPT-5.6 Luna 虽规模更小,也在每个子项上优于 GPT-5.5 Instant。这些是厂商报告的评测结果,宜作为健康能力方向性信号。

相关词条

  • Evals(评估) — HealthBench 属于安全与健康评测,其长度调整方法也是通用 eval 设计的一例
  • System Card(系统卡) — 健康评测结果随系统卡披露
  • GPT-5.6 — 在 August 更新中报告 HealthBench 各子项分数
参考来源
  1. 1. https://openai.com/index/healthbench/
  2. 2. https://deploymentsafety.openai.com/gpt-5-6-august-update
  3. 3. https://cdn.openai.com/dd128428-0184-4e25-b155-3a7686c7d744/HealthBench-Professional.pdf
评论