中文

ReportBench:基于学术调查任务评估深度研究代理的基准测试

计算与语言 2025-08-25 v1 人工智能

摘要

深度研究代理的出现大大减少了执行广泛研究任务所需的时间。然而,这类任务本身对事实准确性和全面性要求严格,必须在广泛采用前进行彻底评估。本文提出 ReportBench,一个系统性基准,用于评估大语言模型(LLM)生成的研究报告内容质量。我们的评估聚焦两个关键维度:(1)引用文献的质量与相关性,(2)生成报告中陈述的忠实性与真实性。ReportBench 利用 arXiv 上高质量的综述论文作为金标准参考资料,应用逆向提示工程推导领域特定提示,构建全面的评估语料库。此外,我们在 ReportBench 中开发基于代理的自动化框架,系统分析生成的报告,通过提取引用和陈述,检查引用内容是否忠实于原始来源,并使用 web 资源验证非引用的主张。经验评估表明,来自 OpenAI 和 Google 等商业深度研究代理 consistently 生成更全面更可靠的报告,超越独立使用搜索或浏览工具的 LLM。然而,在研究覆盖范围的广度和深度,以及事实一致性方面仍有显著提升空间。完整的代码和数据将在以下链接发布:https://github.com/ByteDance-BandAI/ReportBench

关键词

引用

@article{arxiv.2508.15804,
  title  = {ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks},
  author = {Minghao Li and Ying Zeng and Zhihao Cheng and Cong Ma and Kai Jia},
  journal= {arXiv preprint arXiv:2508.15804},
  year   = {2025}
}