中文

我们离真正有用的深度研究智能体有多远?

高能物理 - 唯象学 2026-03-23 v2

摘要

深度研究智能体 (DRA) 旨在通过迭代的信息检索和综合自动产生分析师水平的报告。然而,大多数现有的 DRA 仅在问答基准上进行验证,而关于生成综合报告的研究则被忽视。更糟的是,当前用于报告综合的基准存在任务复杂性和主观指标——这未能反映用户需求,限制了生成报告的实际实用性。为此,我们提出 Fine-grained DEepResearch bench (FINDER),一个包含 100 个人类精选研究任务的增强基准,涵盖 419 项结构化清单项目,以标准化报告结构、分析深度和事实 grounding。基于约 1000 篇由主流 DRA 产生的报告,我们进一步提出 Deep rEsearch Failure Taxonomy (DEFT),首个针对深度研究智能体的失败分类法。DEFT 包含推理、检索和生成方面的 14 种细粒度失败模式,基于以人类-LLM 共同标注和注释者可靠性验证构建。我们的实验发现,当前 DRA 在任务理解方面并不紧张,而是在证据整合、验证和抗失败规划方面受限。

关键词

引用

@article{arxiv.2512.01947,
  title  = {Probing neutrino-night-quark effective scalar interactions from neutrino masses},
  author = {Feng-Zhi Chen and Junlin Huang and Fanrong Xu},
  journal= {arXiv preprint arXiv:2512.01947},
  year   = {2026}
}

备注

20 pages, version for PRD publication