中文

MedBench v4:面向中文医疗语言模型、多模态模型与智能代理的稳健可扩展基准

计算与语言 2025-11-20 v2

摘要

近期医学大语言模型(LLM)、多模态模型和智能代理的快速发展,要求评估框架能够反映真实临床工作流程并满足安全约束。我们提出 MedBench v4,一个全国性、云端基准设施,包含超过 70 万个由专家精选的任务,覆盖 24 个主要专科和 91 个次要专科,并设有专为 LLM、多模态模型和智能代理设计的专项评估。项目经过多阶段精炼和多轮由来自 500 多所机构的临床医生进行评审,开放式回答由经过校准的人类评分的 LLM 作为评判员进行评分。我们对 15 个前沿模型进行了评估。基础 LLM 平均得分为 54.1 分(最佳:Claude Sonnet 4.5,62.5 分),但在安全与伦理方面的表现仍较低(18.4 分)。多模态模型总体表现更差(平均 47.5 分;最佳:GPT-5,54.9 分),其感知能力较好,但跨模态推理较弱。基于相同底层模型构建的智能代理显著提升了端到端性能(平均 79.8 分),以 Claude Sonnet 4.5 为基础的代理在整体得分达到 85.3 分,安全任务得分达到 88.9 分。MedBench v4 因此揭示了基础模型在多模态推理和安全方面仍存下的差距,而表明治理导向的智能代理编排能够在不牺牲能力的前提下显著提升基准临床准备度。通过将任务与中国临床指南和监管优先事项对齐,该平台为医院、开发者和政策制定者审计医疗 AI 提供了实用参考。

关键词

引用

@article{arxiv.2511.14439,
  title  = {MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents},
  author = {Jinru Ding and Lu Lu and Chao Ding and Mouxiao Bian and Jiayuan Chen and Wenrao Pang and Ruiyao Chen and Xinwei Peng and Renjie Lu and Sijie Ren and Guanxu Zhu and Xiaoqin Wu and Zhiqiang Liu and Rongzhao Zhang and Luyi Jiang and Bing Han and Yunqiu Wang and Jie Xu},
  journal= {arXiv preprint arXiv:2511.14439},
  year   = {2025}
}