LiveClin:面向临床实践的在线临床基准测试
机器学习
2026-02-20 v1 人工智能
摘要
医学大语言模型评估的可靠性因数据污染和知识过时而受到严重挑战,导致静态基准测试得分被高估。为解决此问题,我们提出LiveClin——一个面向临床实践的在线基准测试。基于当代同行评审病例报告构建,采用双年更新机制,确保临床数据的时效性并抵御数据污染。我们构建了包含239名医生的验证AI-人类工作流程,将真实病例转化为横跨整个临床路径的复杂多模态评估场景。当前基准包含1,407个病例报告和6,605个问题。对26个模型在LiveClin上的评估显示,这些真实场景的难度极大,最佳模型仅实现35.7%的病例准确率。在与人类专家基准测试中,主任医生准确率最高,其次是住院医生,二者均超越了大多数模型。LiveClin因此提供了一个持续演进、临床导向的框架,以指导医学大语言模型的开发,弥合这一差距,实现更高的可靠性和实际应用价值。我们的数据和代码已公开于https://github.com/AQ-MedAI/LiveClin。
引用
@article{arxiv.2602.16747,
title = {LiveClin: A Live Clinical Benchmark without Leakage},
author = {Xidong Wang and Shuqi Guo and Yue Shen and Junying Chen and Jian Wang and Jinjie Gu and Ping Zhang and Lei Liu and Benyou Wang},
journal= {arXiv preprint arXiv:2602.16747},
year = {2026}
}