中文

HealthBench Professional:基于真实临床对话评估大语言模型

计算与语言 2026-05-01 v1

摘要

数百万临床医生使用 ChatGPT 来辅助临床诊疗,但针对模型与临床医生对话中最常见用例的评估仍然有限。我们推出了 HealthBench Professional,这是一个开放基准,用于评估大语言模型在临床医生工作过程中向 ChatGPT 提出的真实任务上的表现。该基准围绕临床实践的三个常见核心用例构建:诊疗咨询、文书撰写与记录,以及医学研究。每个示例都包含一段由医生撰写的与 ChatGPT for Clinicians 的对话,并通过由三位或以上医生在三个阶段中编写并反复裁定的评分标准进行评分。HealthBench Professional 的示例经过精心挑选,兼顾质量、代表性以及对 OpenAI 当前前沿模型的难度,以便能够持续衡量进展。相对于包含 15,079 个示例的候选池,对近期 OpenAI 模型而言困难的示例被丰富了约 3.5 倍。此外,约三分之一的示例涉及医生对模型进行故意的对抗性测试。作为一个强有力的基线,我们还收集了人类医生对所有任务的回答(不限时间、匹配专科、可访问网络)。得分最高的系统,即 ChatGPT for Clinicians 中的 GPT-5.4,其表现优于基础版 GPT-5.4、所有其他模型以及人类医生。我们希望 HealthBench Professional 能为医疗人工智能社区提供一个衡量标准,以追踪前沿模型在真实世界临床任务中的进展,并构建临床医生可以信赖以改善医疗服务的系统。

关键词

引用

@article{arxiv.2604.27470,
  title  = {HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats},
  author = {Rebecca Soskin Hicks and Mikhail Trofimov and Dominick Lim and Rahul K. Arora and Foivos Tsimpourlas and Preston Bowman and Michael Sharman and Chi Tong and Kavin Karthik and Arnav Dugar and Akshay Jagadeesh and Khaled Saab and Johannes Heidecke and Ashley Alexander and Nate Gross and Karan Singhal},
  journal= {arXiv preprint arXiv:2604.27470},
  year   = {2026}
}

备注

Data link in paper; Blog: https://openai.com/index/making-chatgpt-better-for-clinicians/