多轮医疗诊断基准测试:Hold、Lure 与自我纠正
计算与语言
2026-04-07 v1
摘要
大语言模型 (LLM) 在医疗诊断中实现了高准确率,当所有临床信息一次性提供时;然而在更贴近真实临床推理的多轮证据积累场景下,其行为如何仍未探讨。我们引入 MINT (Medical Incremental N-Turn Benchmark),一个高保真、多轮医疗诊断基准,包含 1,035 案例,具有临床标注证据碎片、受控的轮次粒度和信息保护的分解。通过对 MINT 上 11 个 LLM 进行系统评估,我们发现三个持久的行为模式显著影响诊断决策:(1) 答题意图,模型在收集足够证据之前就急于作答,超过 55% 的答案在前两个轮次即被提交;(2) 自我纠正,错误到正确的答案修正率是正确到错误的翻转率的约 10.6 倍,揭示了模型具备自我纠正的潜在能力,而过早的答题提交则限制了这一潜力;(3) 强诱导,临床关键信息如实验室结果会触发过早作答,即使模型被明确指示要等待。我们将这些发现转化为临床可操作指导:推迟诊断问题至后续轮次可减少过早作答,提高首次答题准确率最高可提升 62.6%;将关键临床证据保留至后续轮次可防止因过早答题导致的准确率灾难性下降,最高可达 23.3%。我们的工作提供了受控的评估框架和具体的改进建议,以提高 LLM 在多轮医疗诊断中的可靠性。
引用
@article{arxiv.2604.04325,
title = {Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction},
author = {Jinrui Fang and Runhan Chen and Xu Yang and Jian Yu and Jiawei Xu and Ashwin Vinod and Wenqi Shi and Tianlong Chen and Heng Ji and ChengXiang Zhai and Ying Ding and Yuji Zhang},
journal= {arXiv preprint arXiv:2604.04325},
year = {2026}
}