超越排行榜:重新思考大语言模型医学基准测试
计算与语言
2026-04-30 v2 人工智能
计算机视觉与模式识别
机器学习
多媒体
摘要
大型语言模型(LLM)在医疗领域展现出巨大的潜力,催生了大量基准测试以评估其能力。然而,这些基准测试的可靠性仍存疑虑,因其常缺乏临床实践的真实性、健全的数据管理以及面向安全的评估指标。为此,我们引入了MedCheck——首个专为医学基准测试设计的、贯穿生命周期的评估框架。该框架将基准测试开发分解为从设计到治理的五个连续阶段,并提供46项医学专属准则的综合检查清单。通过MedCheck,对53个医学LLM基准测试进行深入实证评估。我们的分析揭示了广泛且系统性的问题,包括与临床实践的严重脱节、因未消除的数据污染风险导致的数据完整性危机,以及对安全关键评估维度(如模型鲁棒性和不确定性意识)的系统性忽视。基于这些发现,MedCheck既是现有基准测试的诊断工具,也是推动医疗AI评估更标准化、可靠且透明方法的可操作指南。
引用
@article{arxiv.2508.04325,
title = {Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models},
author = {Wenting Chen and Guo Yu and Yiu-Fai Cheung and Meidan Ding and Jie Liu and Zizhan Ma and Wenxuan Wang and Linlin Shen},
journal= {arXiv preprint arXiv:2508.04325},
year = {2026}
}
备注
Accepted by ACL 2026