中文

MedAction: 面向主动多轮临床诊断型大语言模型

计算与语言 2026-05-11 v1 人工智能

摘要

现有的大多数LLM诊断都在静态、单轮设置下评估,此时已提供完整的患者信息,这简化了真实临床实践。我们研究主动诊断:从初始观察、订立检查、解释结果、并在多个循环中更新差别诊断的临床实践过程。通过系统性分析,我们识别出当前LLM存在三个反复出现的失败模式:无依据的测试订立、不可靠的诊断更新、以及多轮连贯性下降。这些失败共同揭示了一个核心缺陷:现有的医学训练数据教导模型从完整信息进行推理,但并非在演进、部分证据下行动。为弥补这一差距,我们引入MedAction,一套树状蒸馏管线,通过LLM-环境交互合成多样且高质量的多轮诊断轨迹。我们提出两种基于知识图谱的指标来筛选轨迹质量:疾病轨迹一致性(DTC),跟踪模型假设是否趋向正确诊断;推理-行动一致性(RAC),验证信念更新是否由收集的证据驱动。使用此管线,我们构建MedAction-32K,包含32,681条来自2,896个PMC案例的轨迹。在MedAction-32K上微调8B模型,在MedR-Bench和我们精选的MedAction-300-Hard基准中实现开源模型的最新表现,推动开源医学LLM的边界。

关键词

引用

@article{arxiv.2605.07305,
  title  = {MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs},
  author = {Hsin-Ling Hsu and Zizheng Wang and Donghua Zhang and Nai-Chia Chen and Jerry Wang and Jun-En Ding and Chia-Hsuan Hsu and Guoan Wang and Feng Liu and Fang-Ming Hung and Chenwei Wu and Liyue Shen},
  journal= {arXiv preprint arXiv:2605.07305},
  year   = {2026}
}