中文

膨胀的卓越还是真正的表现?通过动态评估重新思考医学诊断基准

计算与语言 2026-04-21 v2 人工智能

摘要

医学诊断是一个高风险且复杂的领域,对患者护理至关重要。然而,当前对大语言模型(LLM)的评估在捕捉临床诊断场景的关键挑战方面仍然有限。大多数评估依赖于来自公开考试的基准数据,引发可能导致性能虚高的污染偏差,并且它们忽略了真实咨询中超出教科书案例的混淆因素。近期的动态评估提供了一个有前景的替代方案,但往往不足以支持面向诊断的基准测试,对临床基础的混淆因素和可信度的覆盖有限(超越准确性)。为了弥补这些差距,我们提出了 DyReMe,一个用于医学诊断的动态基准测试,为诊断鲁棒性提供受控且可扩展的压力测试。与静态考试风格的问题不同,DyReMe 生成新鲜的、咨询风格的案例,其中纳入了临床基础的混淆因素,如鉴别诊断和常见误诊因素。它还变化表达风格以捕捉异质性的患者风格描述。除了准确性之外,DyReMe 在三个额外的临床相关维度上评估 LLMs:真实性、有用性和一致性。我们的实验表明,这种动态方法产生了更具挑战性的评估,并在临床混淆的诊断设置下暴露了最先进的 LLM 的实质性弱点。这些发现强调了迫切需要能够更好地评估在临床基础混淆因素下可信医学诊断的评估框架。

关键词

引用

@article{arxiv.2510.09275,
  title  = {Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation},
  author = {Xiangxu Zhang and Lei Li and Yanyun Zhou and Xiao Zhou and Yingying Zhang and Xian Wu},
  journal= {arXiv preprint arXiv:2510.09275},
  year   = {2026}
}

备注

Accepted by ACL 2026 Main Conference