LiveMedBench:面向大语言模型的无数据污染医学基准,基于自动化评分标准的评估
人工智能
2026-02-12 v1
摘要
在高风险临床环境中部署大语言模型(LLM)需要严格可靠的评估。然而,现有医学基准保持静态,存在两个关键局限性:(1) 数据污染,测试集不可避免地泄露到训练语料库中,导致性能估计被高估;(2) 时序错位,无法捕捉医学知识的快速演进。此外,当前针对开放式临床推理的评估指标要么依赖浅层词汇重叠(如 ROUGE),要么依赖主观的 LLM 评估评分,二者均不足以验证临床正确性。为弥合这一差距,我们引入 LiveMedBench,一个持续更新、无数据污染且基于评分标准的基准,周度从线上医学社区采集真实临床案例,确保与模型训练数据严格的时间分离。我们提出了多智能体临床策展框架,用于过滤原始数据的噪声并针对循证医学原则验证临床完整性。对于评估,我们开发了基于自动化评分标准的评估框架,将医生响应分解为细粒度、案例特定的准则,显著提高了与专家医生的对齐程度。到目前为止,LiveMedBench 包含 2,756 个真实世界案例,覆盖 38 个医学专科和多种语言,配备 16,702 条独特评估准则。对 38 个大语言模型的广泛评估显示,即使是表现最佳的模型也仅达到 39.2%,且 84% 的模型在切除后案例中表现下降,这确认了普遍存在的数据污染风险。错误分析进一步识别出情境应用——而非事实知识——为主要瓶颈,其中 35-48% 的失败源于无法将医学知识针对患者特定约束进行调整。
引用
@article{arxiv.2602.10367,
title = {LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation},
author = {Zhiling Yan and Dingjie Song and Zhe Fang and Yisheng Ji and Xiang Li and Quanzheng Li and Lichao Sun},
journal= {arXiv preprint arXiv:2602.10367},
year = {2026}
}