教导大型语言模型像专家诊断医师一样推理
人工智能
2026-05-26 v2 计算机视觉与模式识别
摘要
鉴别诊断是一个将患者信息与更广泛的医学知识相结合的迭代过程。自1923年起持续出版的NEJM临床病理学会议(CPCs)等临床病例系列,展示了专家医师向同行演示诊断推理的过程,数十年来一直被用于评估AI。然而,以往的AI评估主要侧重于最终的诊断准确性,而非精细的临床推理。在此,我们提出Dr. CaBot,这是一个智能体AI系统,仅凭初始病例描述即可生成书面和旁白幻灯片演示,从而模拟专家诊断医师。CaBot近期生成了NEJM CPCs 100多年历史上首个由AI作出的诊断。在盲法评估中,医师在46/62(74%)的试验中误判了鉴别诊断的来源(CaBot还是医师撰写),并在各个质量维度上给予了良好评价。在处理来自NIH未确诊疾病网络的72名未确诊疾病患者的病例时,CaBot仅凭转诊记录就在50/72(69%)的病例中确定了初步诊断。为了促进透明度和研究,我们还开发了CPC-Bench,这是一个基于7,102个CPC和跨10项任务的47,648个问题的经医师验证的基准。我们表明CaBot在CPC-Bench上优于前沿模型,并公开发布CaBot和CPC-Bench以促进临床AI的发展。
引用
@article{arxiv.2509.12194,
title = {Teaching large language models to reason like expert diagnosticians},
author = {Thomas A. Buckley and Riccardo Conci and Peter G. Brodeur and Jason Gusdorf and Sourik Beltrán and Bita Behrouzi and Byron Crowe and Jacob Dockterman and Muzzammil Muhammad and Sarah Ohnigian and Andrew Sanchez and James A. Diao and Aashna P. Shah and Daniel Restrepo and Eric S. Rosenberg and Andrew S. Lea and Emily Glanton and Kimberly LeBlanc and Undiagnosed Diseases Network and Marinka Zitnik and Scott H. Podolsky and Zahir Kanjee and Raja-Elie E. Abdulnour and Jacob M. Koshy and Adam Rodman and Arjun K. Manrai},
journal= {arXiv preprint arXiv:2509.12194},
year = {2026}
}