中文

超越排行榜:重新思考大语言模型医学基准测试

计算与语言 2026-04-30 v2 人工智能 计算机视觉与模式识别 机器学习 多媒体

摘要

大型语言模型(LLM)在医疗领域展现出巨大的潜力,催生了大量基准测试以评估其能力。然而,这些基准测试的可靠性仍存疑虑,因其常缺乏临床实践的真实性、健全的数据管理以及面向安全的评估指标。为此,我们引入了MedCheck——首个专为医学基准测试设计的、贯穿生命周期的评估框架。该框架将基准测试开发分解为从设计到治理的五个连续阶段,并提供46项医学专属准则的综合检查清单。通过MedCheck,对53个医学LLM基准测试进行深入实证评估。我们的分析揭示了广泛且系统性的问题,包括与临床实践的严重脱节、因未消除的数据污染风险导致的数据完整性危机,以及对安全关键评估维度(如模型鲁棒性和不确定性意识)的系统性忽视。基于这些发现,MedCheck既是现有基准测试的诊断工具,也是推动医疗AI评估更标准化、可靠且透明方法的可操作指南。

关键词

引用

@article{arxiv.2508.04325,
  title  = {Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models},
  author = {Wenting Chen and Guo Yu and Yiu-Fai Cheung and Meidan Ding and Jie Liu and Zizhan Ma and Wenxuan Wang and Linlin Shen},
  journal= {arXiv preprint arXiv:2508.04325},
  year   = {2026}
}

备注

Accepted by ACL 2026