中文

疗愈之对话:医生代理询问能力的综合评估

计算与语言 2025-10-29 v2

摘要

有效的医生应具备 empathy、expertise、patience 和 clear communication 等综合素质,以好好地治疗患者。近期的进展成功地赋予了 AI 医生诊断技能,尤其是通过主动寻求信息来获取信息的能力。然而,其他良好医生的基本素质仍被忽视。为弥合这一差距,我们提出了 MAQuE(Medical Agent Questioning Evaluation),这是目前最大规模的医疗多轮询问自动综合评估基准。它包含 3000 个真实模拟的患者代理,展示出多样化的语言模式、认知局限、情感反应以及被动披露倾向。我们还引入了多方面的评估框架,涵盖任务成功率、询问专业能力、对话能力、询问效率和患者体验。不同 LLM 的实验揭示了该评估方面存在 substantial 挑战。即使是最先进的模型在询问能力方面也有显著的提升空间。这些模型对真实患者行为的变化极其敏感,这对诊断准确率产生显著影响。此外,我们的细粒度指标暴露了不同评估视角之间的权衡,突显了在实际临床环境中在性能和实用性之间进行权衡的挑战。

关键词

引用

@article{arxiv.2509.24958,
  title  = {The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability},
  author = {Linlu Gong and Ante Wang and Yunghwei Lai and Weizhi Ma and Yang Liu},
  journal= {arXiv preprint arXiv:2509.24958},
  year   = {2025}
}