中文

MLB:用于临床应用中大型语言模型评估的情景驱动基准

机器学习 2026-01-13 v1 人工智能 计算与语言

摘要

大型语言模型 (LLM) 的快速发展为医疗保健带来了变革性潜力,但缺乏评估实际临床实用性的框架,阻碍了其实际部署。现有基准测试测试静态知识,无法捕捉临床实践中所需的动态、以应用为导向的能力。为弥合这一差距,本文引入了 Medical LLM Benchmark (MLB),一个综合性基准,用于评估 LLM 在基础知识和情景推理方面的表现。MLB 包含五个核心维度:医学知识 (MedKQA)、安全伦理 (MedSE)、医学记录理解 (MedRU)、智能服务 (SmartServ) 和智能医疗 (SmartCare)。该基准整合了 22 个数据集(其中 17 个为全新筛选),来自 diverse Chinese 临床来源,覆盖 64 个临床专业领域。其设计特点是严格的筛选流程,涉及 300 名执业医师。此外,我们提供一种可扩展的评估方法,核心是通过在专家标注数据上进行监督式微调 (SFT) 训练的专用评判模型。我们的全面评估了 10 个领先模型,发现关键的翻译差距:排名第一的模型 Kimi-K2-Instruct 在整体准确率为 77.3%,在结构化任务如信息抽取 (MedRU 中准确率 87.8%) 中表现突出,但在患者导向场景 (SmartServ 中准确率 61.3%) 中表现下降。更小的 Baichuan-M2-32B 在安全性得分 (MedSE 中 90.6%) 方面表现突出,凸显了针对性训练的重要性。我们的专用评判模型通过在 19k 条专家标注医疗数据集上进行 SFT 训练,实现了 92.1% 的准确率、94.37% 的 F1 分数和 81.3% 的 Cohen's Kappa 分数,验证了可复制且符合专家标准的评估协议。因此,MLB 提供了一种严格的框架,用于指导开发临床可行的大型语言模型。

关键词

引用

@article{arxiv.2601.06193,
  title  = {MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications},
  author = {Qing He and Dongsheng Bi and Jianrong Lu and Minghui Yang and Zixiao Chen and Jiacheng Lu and Jing Chen and Nannan Du and Xiao Cu and Sijing Wu and Peng Xiang and Yinyin Hu and Yi Guo and Chunpu Li and Shaoyang Li and Zhuo Dong and Ming Jiang and Shuai Guo and Liyun Feng and Jin Peng and Jian Wang and Jinjie Gu and Junwei Liu},
  journal= {arXiv preprint arXiv:2601.06193},
  year   = {2026}
}

备注

11 pages, 4 figures, 5 tables