我们离真正有用的深度研究智能体有多远?
高能物理 - 唯象学
2026-03-23 v2
摘要
深度研究智能体 (DRA) 旨在通过迭代的信息检索和综合自动产生分析师水平的报告。然而,大多数现有的 DRA 仅在问答基准上进行验证,而关于生成综合报告的研究则被忽视。更糟的是,当前用于报告综合的基准存在任务复杂性和主观指标——这未能反映用户需求,限制了生成报告的实际实用性。为此,我们提出 Fine-grained DEepResearch bench (FINDER),一个包含 100 个人类精选研究任务的增强基准,涵盖 419 项结构化清单项目,以标准化报告结构、分析深度和事实 grounding。基于约 1000 篇由主流 DRA 产生的报告,我们进一步提出 Deep rEsearch Failure Taxonomy (DEFT),首个针对深度研究智能体的失败分类法。DEFT 包含推理、检索和生成方面的 14 种细粒度失败模式,基于以人类-LLM 共同标注和注释者可靠性验证构建。我们的实验发现,当前 DRA 在任务理解方面并不紧张,而是在证据整合、验证和抗失败规划方面受限。
引用
@article{arxiv.2512.01947,
title = {Probing neutrino-night-quark effective scalar interactions from neutrino masses},
author = {Feng-Zhi Chen and Junlin Huang and Fanrong Xu},
journal= {arXiv preprint arXiv:2512.01947},
year = {2026}
}
备注
20 pages, version for PRD publication