语言模型的顺序诊断
计算与语言
2025-07-03 v2
摘要
人工智能在扩大专家医学知识和推理获取方面具有巨大潜力。然而,大多数语言模型的评估依赖于静态情景和多项选择题,无法反映临床实践中证据医学的复杂性和细微差别。在临床实践中,医生会迭代地形成和修订诊断假设,依据所学信息调整后续问题和检查,并在作出最终诊断前权衡不断演变的证据。为此,我们提出了顺序诊断基准(Sequential Diagnosis Benchmark),将304个诊断具有挑战性的《新英格兰医学杂志》诊断性病例(clinicopathological conference, NEJM-CPC)转化为步骤化诊断情景。医生或AI从简短病例摘要开始,必须迭代请求来自门卫模型的额外细节——该模型仅在被明确查询时才披露发现。评估不仅关注诊断准确率,还关注医生或AI执行检查和访问的成本。我们还提出了MAI诊断 orchestrator(MAI-DxO),一种模型无关的 orchestrator,模拟一组医生,提出可能的鉴别诊断,战略性地选择高价值且成本效益好的检查。当与OpenAI的o3模型配合使用时,MAI-DxO实现80%的诊断准确率——而通用医生平均为20%。MAI-DxO还比医生降低20%的诊断成本,比off-the-shelf o3降低70%。在追求最高准确率配置时,MAI-DxO实现85.5%的准确率。这些性能提升跨越OpenAI、Gemini、Claude、Grok、DeepSeek和Llama等模型家族。我们强调,当AI系统被引导以迭代方式思考并慎重行动时,可以在临床护理中提升诊断精确度和成本效益。
引用
@article{arxiv.2506.22405,
title = {Sequential Diagnosis with Language Models},
author = {Harsha Nori and Mayank Daswani and Christopher Kelly and Scott Lundberg and Marco Tulio Ribeiro and Marc Wilson and Xiaoxuan Liu and Viknesh Sounderajah and Jonathan Carlson and Matthew P Lungren and Bay Gross and Peter Hames and Mustafa Suleyman and Dominic King and Eric Horvitz},
journal= {arXiv preprint arXiv:2506.22405},
year = {2025}
}
备注
23 pages, 10 figures