中文

MedAgentsBench:面向复杂医学推理的思维模型与智能体框架基准测试

计算与语言 2025-03-21 v2 人工智能

摘要

大型语言模型在现有医学问答基准上表现出色。这种高性能使得有意义地评估和区分先进方法变得越来越困难。我们提出了 MedAgentsBench,一个专注于需要多步临床推理、诊断制定和治疗规划的挑战性医学问题的基准——在这些场景中,当前模型尽管在标准测试上表现强劲,但仍然存在困难。我们的基准取材于七个已建立的医学数据集,解决了现有评估中的三个关键局限:(1)存在大量基础模型即可实现高性能的简单问题;(2)不同研究间采样和评估协议不一致;(3)缺乏对性能、成本和推理时间之间相互作用的系统分析。通过对多种基础模型和推理方法的实验,我们证明了最新的思维模型 DeepSeek R1 和 OpenAI o3 在复杂医学推理任务中表现出卓越性能。此外,与传统方法相比,基于搜索的先进智能体方法提供了有前景的性能成本比。我们的分析揭示了不同模型家族在复杂问题上的显著性能差距,并确定了不同计算约束下的最优模型选择。我们的基准和评估框架已公开发布于 https://github.com/gersteinlab/medagents-benchmark。

关键词

引用

@article{arxiv.2503.07459,
  title  = {MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning},
  author = {Xiangru Tang and Daniel Shao and Jiwoong Sohn and Jiapeng Chen and Jiayi Zhang and Jinyu Xiang and Fang Wu and Yilun Zhao and Chenglin Wu and Wenqi Shi and Arman Cohan and Mark Gerstein},
  journal= {arXiv preprint arXiv:2503.07459},
  year   = {2025}
}