ResearcherBench:在科学探究前沿评估深度 AI 研究系统
人工智能
2025-07-23 v1
摘要
深度研究系统的出现展示了在问题解决方面的重大能力,从基础查询扩展到复杂的研究任务。然而,现有的基准测试主要将这些系统评估为用于网络检索和报告生成的智能体,忽视了它们在科学研究前沿发现新见解的潜力。为了填补这一空白,我们引入了 ResearcherBench,这是第一个专注于评估这些先进的智能体系统(我们称之为深度 AI 研究系统(DARS))在前沿 AI 科学问题上能力的基准测试。我们编制了一个包含 65 个研究问题的数据集,这些问题是从实验室讨论和访谈等真实科学场景中由专家挑选出来的,涵盖 35 个不同的 AI 主题,并分为三种类型:技术细节、文献综述和开放咨询。我们的双重评估框架将使用专家设计标准评估见解质量的评分标准评估与衡量引用准确性(忠实度)和覆盖范围(扎根度)的事实评估相结合。我们评估了几个领先的商业 DARS 和基线系统。结果显示,OpenAI Deep Research 和 Gemini Deep Research 显著优于其他系统,在开放式咨询问题上表现出特别的优势。这种能力代表了迈向 AI 自我改进的重要一步,与 AI 的 ASI 愿景相一致。我们开源了 ResearcherBench,为推动下一代 AI 研究助手的发展提供了一个标准化平台,希望为一种新型科学协作模式下的 AI 研究评估培养新视角:https://github.com/GAIR-NLP/ResearcherBench。
关键词
引用
@article{arxiv.2507.16280,
title = {ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry},
author = {Tianze Xu and Pengrui Lu and Lyumanshan Ye and Xiangkun Hu and Pengfei Liu},
journal= {arXiv preprint arXiv:2507.16280},
year = {2025}
}
备注
22 pages, 3 figures