中文

MedDialogRubrics:用于大语言模型中医疗对话的全面基准与评估框架

计算与语言 2026-01-08 v2 人机交互

摘要

医疗对话 AI 在开发更安全、更有效的医疗对话系统方发挥着关键作用。然而,现有的针对医疗大语言模型(LLM)信息收集和诊断推理能力的基准和评估框架尚未得到严格的评估。为此,我们提出 MedDialogRubrics,一个新颖的基准,包含 5,200 个人工构建的患者病例和 6 万多条由 LLM 生成的细粒度评估评语,经临床专家精炼后用于评估 LLM 的多轮诊断能力。我们的框架采用多智能体系统,从潜在疾病知识中合成真实的患者记录和主诉,而不依赖于实际电子健康记录,从而缓解了隐私和数据治理方面的担忧。我们设计了一个受限于原子医疗事实的数据集,并增添了动态指导机制,以持续检测和纠正对话中的幻觉,确保模拟案例的内在连贯性和临床可信度。此外,我们提出了一种结构化的 LLM 基于和专家标注的评语生成管道,该管道检索证据医学(EBM)指南,并利用拒绝抽样推导出每个案例的优先级评语项目("must-ask" 项目)。我们对当前的 SOTA 模型进行了全面评估,结果表明在多个评估维度上,当前模型面临重大挑战。我们的研究表明,提高医疗对话能力需要在对话管理架构方面取得进展,而不仅仅是对基础模型进行增量调优。

关键词

引用

@article{arxiv.2601.03023,
  title  = {MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models},
  author = {Lecheng Gong and Weimin Fang and Ting Yang and Dongjie Tao and Chunxiao Guo and Peng Wei and Bo Xie and Jinqun Guan and Zixiao Chen and Fang Shi and Jinjie Gu and Junwei Liu},
  journal= {arXiv preprint arXiv:2601.03023},
  year   = {2026}
}