中文

MedMT-Bench:LLM是否能理解和记忆医疗场景下的长期多轮对话?

计算与语言 2026-03-26 v1 人工智能

摘要

大型语言模型(LLM)在 various 专科领域展现出惊人的能力,并被集成到医疗等 high-stakes 领域。然而,现有医疗相关基准很少检验长上下文记忆、干扰鲁棒性和安全防御,这些在实际应用中都是必需的。为填补这一差距,我们引入MedMT-Bench,一个挑战性的医疗多轮指令跟随基准,模拟整个诊断和治疗过程。我们通过 scene-by-scene 数据综合,经专业医师手动编辑后,得到400个 test case,高度一致于真实世界的应用情境。每个 test case 的平均为22轮(最大52轮),覆盖5类困难的指令跟随问题。对于评估,我们提出了 LLM-as-judge 协议,采用 instance-level rubrics 和 atomic test points,经专家注释验证,人类-LLM 一致性达91.94%。我们测试了17个前沿模型,所有模型在MedMT-Bench 上表现不佳(总体准确率低于60%),最佳模型仅达59.75%。MedMT-Bench 可以是推动医疗AI更安全更可靠研究的重要工具。该基准可在 https://openreview.net/attachment?id=aKyBCsPOHB&name=supplementary_material 查阅。

关键词

引用

@article{arxiv.2603.23519,
  title  = {MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?},
  author = {Lin Yang and Yuancheng Yang and Xu Wang and Changkun Liu and Haihua Yang},
  journal= {arXiv preprint arXiv:2603.23519},
  year   = {2026}
}