中文

ThReadMed-QA:来自真实患者提问的多轮医疗对话基准

计算与语言 2026-03-13 v1

摘要

医疗问答基准主要评估单轮交互,无法捕捉真实患者咨询中迭代、寻求澄清的本质特征。我们引入 ThReadMed-QA,这是一个来自 r/AskDocs 提取的包含 2,437 条完整回答的患者-医生对话线索基准,涵盖最高 9 轮,共 8,204 条问答对。不同于依赖模拟对话、对抗提示或考试式问题的前期工作,ThReadMed-QA 捕捉真实患者后续提问及经验证的医生回应,反映患者在线上寻求医疗信息的自然方式。我们对五种最先进的大语言模型——GPT-5、GPT-4o、Claude Haiku、Gemini 2.5 Flash 和 Llama 3.3 70B——在分层测试子集的 238 条对话 (948 条 QA 对) 上进行评估,采用基于医生ground truth 的校准 LLM-as-a-judge 评分标准。即使是最强大的模型 GPT-5,也仅实现 41.2% 的完全正确回应。所有五个模型在第 0 轮到第 2 轮之间显著下降 (p < 0.001),而第三轮的错误回答率约为第 1 轮的三倍。我们识别出一种根本性张力:单轮能力与多轮可靠性之间存在矛盾:表现最强的模型 (GPT-5:75.2;Claude Haiku:72.3 分) 在第 2 轮下降最剧烈 (分别下降 16.2 和 25.0 分),而较弱的模型则趋于平稳或略有改善。我们引入两个指标来量化多轮失效模式:对话一致性得分 (CCS) 和错误传播率 (EPR)。CCS 显示,近三分之一的 Claude Haiku 对话在同一对话线索中在完全正确与完全错误之间来回切换。EPR 显示,单次错误轮数会使随后错误轮数的概率提高 1.9-6.1 倍。

关键词

引用

@article{arxiv.2603.11281,
  title  = {ThReadMed-QA: A Multi-Turn Medical Dialogue Benchmark from Real Patient Questions},
  author = {Monica Munnangi and Saiph Savage},
  journal= {arXiv preprint arXiv:2603.11281},
  year   = {2026}
}