中文

通过模拟口头考试评估大语言模型中的临床推理

机器学习 2025-10-14 v1 人工智能

摘要

医学中的临床推理是一种以假设为驱动的过程,医生通过针对性地获取病史、体格检查和检查结果,从有限信息中不断细化诊断。相比之下,当前大语言模型的医学基准主要通过单轮问题评估知识记忆,提供完整的临床信息。为弥合这一差距,我们引入 VivaBench,一个评估大语言模型代理人顺序临床推理的多轮基准测试。我们的数据集由 1762 个由医生精选的临床案例构成,结构化为模拟医学培训中的口头考试情景,要求代理人主动探寻相关发现、选择合适的检查,并在多个步骤中综合信息以达到诊断。虽然当前大语言模型在诊断已描述的临床表型方面表现出色,但在需要在不确定性下进行迭代诊断推理时,其性能会显著下降。我们的分析识别了若干反映临床实践中常见认知错误的失败模式,包括:(1)对初始假设的固化,(2)不恰当的检查顺序,(3)过早的诊断关闭,以及(4)未能筛查关键疾病。这些模式揭示了当前大语言模型在不确定性下进行推理和决策的根本局限。通过 VivaBench,我们为评估面向实际临床决策支持的对话式医学 AI 系统提供了标准化基准。除医学应用外,我们为 agentic AI 领域的更大研究语料库贡献了通过顺序推理轨迹在复杂决策环境中发生分歧的证据。

关键词

引用

@article{arxiv.2510.10278,
  title  = {Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models},
  author = {Christopher Chiu and Silviu Pitis and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2510.10278},
  year   = {2025}
}