中文

Medmarks:面向医疗任务的全新开源 LLM 基准套件

计算与语言 2026-05-05 v1 人工智能

摘要

评估大型语言模型(LLM)用于医疗应用仍存在挑战,主要由于基准饱和、数据可访问性有限以及覆盖相关任务不足。现有基准套件要么已饱和,要么严重依赖受限数据集,要么缺乏全面的模型覆盖。我们介绍 Medmarks,一个完全开源的评估套件,包含 30 个基准,涵盖问答、信息抽取、医学计算以及开放式临床推理。我们对 61 个模型进行系统评估,涵盖 71 种配置,使用可验证的指标和 LLM 作为评判器。我们的结果显示,前沿推理模型(Gemini 3 Pro Preview、GPT-5.1 与 GPT-5.2)在两项基准测试中取得最高性能;大多数前沿专有模型在 token 效率方面显著优于开源权重替代方案;医学微调模型优于其通用型同类模型;且模型对答案顺序偏差具有敏感性(尤其是较小的模型和 Grok 4)。我们Subsets 中的一部分评估(Medmarks-T)可直接用作强化学习环境,以后训练 LLM 以提高医学推理能力。代码已置于 https://github.com/MedARC-AI/Medmarks

关键词

引用

@article{arxiv.2605.01417,
  title  = {Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks},
  author = {Benjamin Warner and Ratna Sagari Grandhi and Max Kieffer and Aymane Ouraq and Saurav Panigrahi and Geetu Ambwani and Kunal Bagga and Nikhil Khandekar and Arya Hariharan and Nishant Mishra and Manish Ram and Shamus Sim Zi Yang and Ahmed Essouaied and Adepoju Jeremiah Moyondafoluwa and Robert Scholz and Bofeng Huang and Molly Beavers and Srishti Gureja and Anish Mahishi and Sameed Khan and Maxime Griot and Hunar Batra and Jean-Benoit Delbrouck and Siddhant Bharadwaj and Ronald Clark and Ashish Vashist and Anas Zafar and Leema Krishna Murali and Harsh Deshpande and Ameen Patel and William Brown and Johannes Hagemann and Connor Lane and Paul Steven Scotti and Tanishq Mathew Abraham},
  journal= {arXiv preprint arXiv:2605.01417},
  year   = {2026}
}

备注

website: https://medmarks.ai