大语言模型在医生推理任务中的超人表现
人工智能
2025-06-04 v3 计算与语言
摘要
1959年,Ledley 和 Lusted 发表的论文引入了复杂的临床诊断推理案例作为专家医学计算系统评估的黄金标准,此标准自此坚持至今。本文报告了对大语言模型(LLM)在挑战性临床案例上的结果,基准为数百名医生。我们进行了五项实验,以衡量临床推理 across differential diagnosis generation、诊断推理展示、分诊差异诊断、概率推理和管理推理,由具有验证心理测量工具的医学专家评审。随后,我们报告了一项真实世界的研究,比较了人类专家和 AI 第二意见在波士顿一家大型学术医院急诊室的随机患者。我们将 LLM 与板证医生在三个预定义的诊断触点:急诊室分诊、医生初始评估和入院或重症监护病房 admission 比较。在所有实验——无论是情景还是急诊室第二意见——LLM 显示出超人类的诊断和推理能力,以及持续从前一代 AI 临床决策支持系统中获得的改进。我们的研究表明,LLM 已在一般医学诊断和管理推理方面实现了超人表现,实现了 Ledley 和 Lusted 所设想的愿景,并推动了对前瞻性试验的紧迫需求。
引用
@article{arxiv.2412.10849,
title = {Superhuman performance of a large language model on the reasoning tasks of a physician},
author = {Peter G. Brodeur and Thomas A. Buckley and Zahir Kanjee and Ethan Goh and Evelyn Bin Ling and Priyank Jain and Stephanie Cabral and Raja-Elie Abdulnour and Adrian D. Haimovich and Jason A. Freed and Andrew Olson and Daniel J. Morgan and Jason Hom and Robert Gallo and Liam G. McCoy and Haadi Mombini and Christopher Lucas and Misha Fotoohi and Matthew Gwiazdon and Daniele Restifo and Daniel Restrepo and Eric Horvitz and Jonathan Chen and Arjun K. Manrai and Adam Rodman},
journal= {arXiv preprint arXiv:2412.10849},
year = {2025}
}