中文

提升与评估开放深度研究代理

人工智能 2026-01-09 v2

摘要

本文聚焦于深度研究代理(DRAs)——即能够接收用户自然语言提示后,自主搜索并利用 internet 内容以解决该提示的系统。近期 DRAs 在公开基准测试上展现出惊人的能力,但近期研究主要集中于专有封闭源系统。目前仅发现一个开源 DRAs,称为 Open Deep Research(ODR)。本文将最近的 BrowseComp 基准调整以适用于 ODR 与现有专有系统间的比较。我们提出 BrowseComp-Small(BC-Small),作为更计算可行的学术实验室专用 DRA 基准。我们在 BC-Small 上对 ODR 与两个专有系统进行基准测试:一个来自 Anthropic,一个来自 Google。我们发现所有三个系统在该测试集 60 题上的准确率均为 0%。我们引入三个战略性改进,使得 ODR+ 模型在 BC-Small 上实现了开源与封闭源系统的首创性 10% 成功率。我们报告了消融实验,表明我们提出的三个改进均对 ODR+ 的成功产生了贡献。

关键词

引用

@article{arxiv.2508.10152,
  title  = {Improving and Evaluating Open Deep Research Agents},
  author = {Doaa Allabadi and Kyle Bradbury and Jordan M. Malof},
  journal= {arXiv preprint arXiv:2508.10152},
  year   = {2026}
}

备注

8 pages, 2 figures, 2 tables