提升与评估开放深度研究代理
人工智能
2026-01-09 v2
摘要
本文聚焦于深度研究代理(DRAs)——即能够接收用户自然语言提示后,自主搜索并利用 internet 内容以解决该提示的系统。近期 DRAs 在公开基准测试上展现出惊人的能力,但近期研究主要集中于专有封闭源系统。目前仅发现一个开源 DRAs,称为 Open Deep Research(ODR)。本文将最近的 BrowseComp 基准调整以适用于 ODR 与现有专有系统间的比较。我们提出 BrowseComp-Small(BC-Small),作为更计算可行的学术实验室专用 DRA 基准。我们在 BC-Small 上对 ODR 与两个专有系统进行基准测试:一个来自 Anthropic,一个来自 Google。我们发现所有三个系统在该测试集 60 题上的准确率均为 0%。我们引入三个战略性改进,使得 ODR+ 模型在 BC-Small 上实现了开源与封闭源系统的首创性 10% 成功率。我们报告了消融实验,表明我们提出的三个改进均对 ODR+ 的成功产生了贡献。
关键词
引用
@article{arxiv.2508.10152,
title = {Improving and Evaluating Open Deep Research Agents},
author = {Doaa Allabadi and Kyle Bradbury and Jordan M. Malof},
journal= {arXiv preprint arXiv:2508.10152},
year = {2026}
}
备注
8 pages, 2 figures, 2 tables