中文

BioMedArena:用于构建与评估生物医学深度研究智能体的开源工具包

人工智能 2026-05-08 v1

摘要

如今构建深度研究智能体无异于编写胶水代码:同一骨干网络在同一基准上评估,由于测试框架与工具注册表各异,不同论文中报告的准确率可能大相径庭;而将新的基础模型集成到可比的评估界面中,需要耗费数周针对特定模型的工程开发。我们将此称为“单篇论文工程税”,并发布 BioMedArena——一个开源工具包,它不仅减轻了这一负担,还提供了一个在将不同基础模型作为深度研究智能体评估时进行公平比较的竞技场。BioMedArena 将生物医学智能体评估的六个层次解耦——基准加载、工具暴露、工具选择、执行模式、上下文管理与评分——并跨 9 个功能族暴露了 147 个生物医学基准与 75 个生物医学工具。添加新模型、基准或工具简化为注册一个几行代码的提供者适配器。我们进一步提供了 6 种智能体测试框架与 6 种上下文管理策略,为 12 个骨干网络提供了具备竞争力的研究能力并显著提升了性能,在 8 个代表性生物医学基准上取得了 SOTA 结果,较先前 SOTA 平均提升 +15.03 个百分点。该工具包、配置及各任务轨迹可在 https://github.com/AI-in-Health/BioMedArena 获取

关键词

引用

@article{arxiv.2605.06177,
  title  = {BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents},
  author = {Jinge Wu and Hongjian Zhou and Mingde Zeng and Jiayuan Zhu and Junde Wu and Jiazhen Pan and Sean Wu and Honghan Wu and Fenglin Liu and David A. Clifton},
  journal= {arXiv preprint arXiv:2605.06177},
  year   = {2026}
}