中文

MedHELM:面向医疗任务的大型语言模型全面评估

计算与语言 2025-06-03 v2 人工智能

摘要

尽管大型语言模型(LLM)在医疗执照考试中取得了近乎满分的成绩,但这些评估未能充分反映真实世界临床实践的复杂性与多样性。我们提出了 MedHELM,一个用于评估医疗任务中 LLM 表现的可扩展评估框架,包含三项关键贡献。第一,由临床医生验证的分类体系,涵盖 5 个类别、22 个子类别和 121 项任务,由 29 位临床医生共同开发。第二,包含 35 个基准测试(17 个现有,18 个新制定)的综合基准套件,为分类体系中的所有类别和子类别提供完整覆盖。第三,利用改进的评估方法(使用 LLM 评审团)对 LLM 进行系统比较及成本效益分析。使用这 35 个基准测试对 9 个前沿 LLM 的评估揭示了显著的性能差异。高级推理模型(DeepSeek R1:66% 胜率;o3-mini:64% 胜率)表现出更优的性能,尽管 Claude 3.5 Sonnet 在估计计算成本降低 40% 的情况下取得了可比的结果。在归一化准确率量表(0-1)上,大多数模型在临床笔记生成(0.73-0.85)和患者沟通与教育(0.78-0.83)方面表现强劲,在医学研究辅助(0.65-0.75)方面表现中等,而在临床决策支持(0.56-0.72)和行政与工作流程(0.53-0.63)方面普遍较低。我们的 LLM 评审团评估方法与临床医生评分取得了良好的一致性(ICC = 0.47),超过了临床医生之间的平均一致性(ICC = 0.43)以及包括 ROUGE-L(0.36)和 BERTScore-F1(0.44)在内的自动化基线。Claude 3.5 Sonnet 以更低的估计成本实现了与顶级模型可比的性能。这些发现强调了针对 LLM 医疗应用进行真实世界、特定任务评估的重要性,并提供了一个开源框架以实现这一目标。

关键词

引用

@article{arxiv.2505.23802,
  title  = {MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks},
  author = {Suhana Bedi and Hejie Cui and Miguel Fuentes and Alyssa Unell and Michael Wornow and Juan M. Banda and Nikesh Kotecha and Timothy Keyes and Yifan Mai and Mert Oez and Hao Qiu and Shrey Jain and Leonardo Schettini and Mehr Kashyap and Jason Alan Fries and Akshay Swaminathan and Philip Chung and Fateme Nateghi and Asad Aali and Ashwin Nayak and Shivam Vedak and Sneha S. Jain and Birju Patel and Oluseyi Fayanju and Shreya Shah and Ethan Goh and Dong-han Yao and Brian Soetikno and Eduardo Reis and Sergios Gatidis and Vasu Divi and Robson Capasso and Rachna Saralkar and Chia-Chun Chiang and Jenelle Jindal and Tho Pham and Faraz Ghoddusi and Steven Lin and Albert S. Chiou and Christy Hong and Mohana Roy and Michael F. Gensheimer and Hinesh Patel and Kevin Schulman and Dev Dash and Danton Char and Lance Downing and Francois Grolleau and Kameron Black and Bethel Mieso and Aydin Zahedivash and Wen-wai Yim and Harshita Sharma and Tony Lee and Hannah Kirsch and Jennifer Lee and Nerissa Ambers and Carlene Lugtu and Aditya Sharma and Bilal Mawji and Alex Alekseyev and Vicky Zhou and Vikas Kakkar and Jarrod Helzer and Anurang Revri and Yair Bannett and Roxana Daneshjou and Jonathan Chen and Emily Alsentzer and Keith Morse and Nirmal Ravi and Nima Aghaeepour and Vanessa Kennedy and Akshay Chaudhari and Thomas Wang and Sanmi Koyejo and Matthew P. Lungren and Eric Horvitz and Percy Liang and Mike Pfeffer and Nigam H. Shah},
  journal= {arXiv preprint arXiv:2505.23802},
  year   = {2025}
}