中文

HealthBench:评估大型语言模型以改善人类健康

计算与语言 2025-05-14 v1

摘要

我们提出了 HealthBench,这是一个衡量大型语言模型在医疗保健领域性能和安全性的开源基准测试。HealthBench 包含5,000个来自模型与个人用户或医疗专业人员之间的多轮对话。响应采用由262名医生创建的对话特定评估标准进行评估。不同于以往的多选或简答型基准测试,HealthBench 通过48,562个独特评估标准,涵盖多个健康情境(如紧急情况、转换临床数据、全球健康)和行为维度(如准确性、指令遵循、沟通),实现真实、开放式的评估。HealthBench 的性能数据反映了过去两年的稳步初始进步(对比 GPT-3.5 Turbo 的16%到 GPT-4o 的32%)以及更快的近期改进(o3 得分60%)。更小的模型尤其取得了显著进步:GPT-4.1 nano 超越 GPT-4o,且成本降低25倍。我们另外发布了两个 HealthBench 变体:HealthBench Consensus 包含经医生共识验证的34个重要行为维度,HealthBench Hard 中的当前最高得分为32%。我们希望 HealthBench 为推动模型开发和应用进步,最终惠及人类健康,提供坚实的基础。

关键词

引用

@article{arxiv.2505.08775,
  title  = {HealthBench: Evaluating Large Language Models Towards Improved Human Health},
  author = {Rahul K. Arora and Jason Wei and Rebecca Soskin Hicks and Preston Bowman and Joaquin Quiñonero-Candela and Foivos Tsimpourlas and Michael Sharman and Meghan Shah and Andrea Vallone and Alex Beutel and Johannes Heidecke and Karan Singhal},
  journal= {arXiv preprint arXiv:2505.08775},
  year   = {2025}
}

备注

Blog: https://openai.com/index/healthbench/ Code: https://github.com/openai/simple-evals