AutoResearchBench:用于复杂科学文献发现的 AI 代理基准测试
人工智能
2026-04-29 v1
摘要
autonomous scientific research 得以显著 advancement 归功于 AI 代理的发展。其中关键步骤之一是找到合适的科学文献,无论是为了探索研究问题的现有知识,还是为了获取验证假设和支持论点所需的证据。为评估 AI 代理在推动这一过程方面的能力,我们提出 AutoResearchBench,一个专门用于自主科学文献发现的基准测试。AutoResearchBench 由两种互补的任务类型组成:(1) 深度研究,需要通过逐步、多阶段的探测过程查找特定的目标论文;(2) 广度研究,需要全面收集满足给定条件的论文集合。与以往基于代理的网页浏览基准测试相比,AutoResearchBench 在三个维度上具有显著区别:它以研究为导向,要求对科学概念进行深入理解;以文献为焦点,要求精细地利用详细信息;是开放性的,涉及未知数量的合格论文,因此需要进行深思熟虑的推理和搜索。这些特性使 AutoResearchBench 独特地适合评估自主研究能力,且极具挑战性。即使是最强大的 LLMs,尽管在一般代理网页浏览基准测试中大多已取得突破,但在深度研究中仅 achieving 9.39% 的准确率,在广度研究中仅 achieving 9.31% 的 IoU,而许多其他强大基准方法也低于 5%。我们公开发布数据集和评估管道以促进此方向的未来研究。我们公开发布数据集、评估管道和代码,地址为 https://github.com/CherYou/AutoResearchBench。
引用
@article{arxiv.2604.25256,
title = {AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery},
author = {Lei Xiong and Kun Luo and Ziyi Xia and Wenbo Zhang and Jin-Ge Yao and Zheng Liu and Jingying Shao and Jianlyu Chen and Hongjin Qian and Xi Yang and Qian Yu and Hao Li and Chen Yue and Xiaan Du and Yuyang Wang and Yesheng Liu and Haiyu Xu and Zhicheng Dou},
journal= {arXiv preprint arXiv:2604.25256},
year = {2026}
}