MedBrowseComp: 医学深度研究与计算机浏览基准测试
计算与语言
2025-05-22 v1
摘要
大型语言模型(LLM)日益被视为临床实践中的决策支持工具,但安全的临床推理需要在严格的准确性约束下整合异构知识库——包括试验、原始研究、监管文件和成本数据。现有评估常依赖合成提示,将任务简化为单跳事实查询,或混合推理与开放式生成,留下了其实际实用性未知的缺口。为填补这一差距,我们提出 MedBrowseComp,首个系统性测试代理可靠检索和综合来自 live、领域特定知识库中多跳医学事实的基准测试。MedBrowseComp 包含超过 1000 个人工精选问题,镜像临床场景——在必须调和碎片化或冲突信息以得出最新结论的情形下。将 MedBrowseComp 应用于前沿 agentic 系统,揭示了性能不足甚至低于 10%,暴露了当前 LLM 能力与临床环境所需严谨性之间的关键差距。MedBrowseComp 因此为可靠的医学信息检索提供了明确基准,并为未来模型和工具链升级设定了具体目标。
关键词
引用
@article{arxiv.2505.14963,
title = {MedBrowseComp: Benchmarking Medical Deep Research and Computer Use},
author = {Shan Chen and Pedro Moreira and Yuxin Xiao and Sam Schmidgall and Jeremy Warner and Hugo Aerts and Thomas Hartvigsen and Jack Gallifant and Danielle S. Bitterman},
journal= {arXiv preprint arXiv:2505.14963},
year = {2025}
}
备注
You can visit our project page at: https://moreirap12.github.io/mbc-browse-app/