BrowseComp-Plus:用于更公平和透明评估深度研究智能体的基准
计算与语言
2025-08-12 v1 信息检索
摘要
深度研究智能体通过将大型语言模型(LLM)与搜索工具集成,已在处理需要迭代搜索规划和对搜索结果进行推理的复杂查询方面取得成功。当前基于BrowseComp等基准的评估依赖黑箱在线搜索API,存在以下显著局限性:(1)公平性:动态且不透明的Web API 阻碍了深度研究方法的公平比较和可复现性;(2)透明性:缺乏对文档语料库的控制,使难以隔离检索器的贡献。也就是说,当前的评估可能在特定时间点对完整的深度研究系统进行比较,但并不促进从而为洞察底层深度研究LLM能力提供受控实验。为解决这些挑战,我们引入BrowseComp-Plus,一个源自BrowseComp的基准,采用固定且经过精心挑选的语料库。BrowseComp-Plus中的每个查询都包含经人工验证的支持性文档和挖掘出的具备挑战性的负样本,使实验具有控制性。该基准被证明在区分深度研究系统的性能方面有效。例如,开源模型Search-R1配合BM25检索器 Achieved 3.86% 的准确率,而GPT-5 Achieved 55.9%。将GPT-5与Qwen3-Embedding-8B检索器集成后,其准确率提升至70.1%,且搜索调用次数更少。这一基准允许对深度研究智能体和检索方法进行全面评估和解耦分析,促进了对深度研究系统中检索效果、引用准确性以及上下文工程的洞察。
引用
@article{arxiv.2508.06600,
title = {BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent},
author = {Zijian Chen and Xueguang Ma and Shengyao Zhuang and Ping Nie and Kai Zou and Andrew Liu and Joshua Green and Kshama Patel and Ruoxi Meng and Mingyi Su and Sahel Sharifymoghaddam and Yanxi Li and Haoran Hong and Xinyu Shi and Xuye Liu and Nandan Thakur and Crystina Zhang and Luyu Gao and Wenhu Chen and Jimmy Lin},
journal= {arXiv preprint arXiv:2508.06600},
year = {2025}
}