DeepResearchGym:面向深度研究的免费、透明且可复现的评估沙盒
信息检索
2025-12-16 v3
摘要
深度研究系统代表了一类新兴的智能体信息检索方法,能够针对复杂查询生成全面且有充分依据的报告。然而,大多数现有框架依赖动态商业搜索 API,这除了成本外,还带来了可复现性和透明度方面的挑战。为解决这些局限性,我们引入了 \textsc{DeepResearchGym} 作为一个开源沙盒,它结合了可复现的搜索 API 和严格的评估协议,用于对深度研究系统进行基准测试。该 API 使用最先进的密集检索器和基于 DiskANN 的近似最近邻搜索,对大规模公共网络语料库(即 ClueWeb22 和 FineWeb)进行索引。它实现了比流行商业 API 更低的延迟,同时确保了跨运行的稳定文档排序,并且对研究用途免费。为了评估深度研究系统的输出,我们通过 LLM-as-a-judge 自动化指标扩展了 Researchy questions 基准,以衡量与用户信息需求的对齐度、检索忠实度和报告质量。实验结果表明,集成 \textsc{DeepResearchGym} 的系统取得了与使用商业 API 的系统相当的性能,且性能排名在各评估指标间保持一致。对简答搜索智能体的案例研究进一步证明了该沙盒在成本效益训练方面的效用,表明在沙盒内训练的模型能够泛化到商业搜索。
引用
@article{arxiv.2505.19253,
title = {DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep Research},
author = {João Coelho and Jingjie Ning and Jingyuan He and Kangrui Mao and Abhijay Paladugu and Pranav Setlur and Jiahe Jin and Jamie Callan and João Magalhães and Bruno Martins and Chenyan Xiong},
journal= {arXiv preprint arXiv:2505.19253},
year = {2025}
}