中文

DeepResearch Bench II:基于专家报告评分细则诊断深度研究智能体

计算与语言 2026-02-02 v2

摘要

深度研究系统(DRS)旨在帮助用户搜索网络、综合信息并交付全面的调查报告。然而,如何严格评估这些系统仍处于探索不足的状态。现有的深度研究基准通常陷入两种失败模式。一些基准未能充分测试系统分析证据和撰写连贯报告的能力。另一些基准依赖的评估标准要么过于粗略,要么直接由 LLM 定义(或两者兼有),导致评分相对于人类专家可能存在偏差,且难以验证或解释。为了解决这些问题,我们引入了 Deep Research Bench II,一个用于评估 DRS 生成报告的新基准。它包含跨 22 个领域的 132 项有依据的研究任务;对于每项任务,系统必须生成一份长篇研究报告,并由总计 9430 条细粒度二元评分细则进行评估,涵盖信息召回、分析和呈现三个维度。所有评分细则均源自精心挑选的专家撰写的调查文章,并通过结合自动提取与超过 400 小时人工专家审查的四阶段 LLM+人工流水线构建而成,确保这些标准是原子化、可验证的,且与人类专家判断相一致。我们在 Deep Research Bench II 上评估了多个最先进的深度研究系统,发现即使是最强的模型也仅满足不到 50% 的评分细则,揭示了当前 DRS 与人类专家之间存在显著差距。

关键词

引用

@article{arxiv.2601.08536,
  title  = {DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report},
  author = {Ruizhe Li and Mingxuan Du and Benfeng Xu and Chiwei Zhu and Xiaorui Wang and Zhendong Mao},
  journal= {arXiv preprint arXiv:2601.08536},
  year   = {2026}
}