中文

你的深度研究代理为何失败?关于全程研究轨迹中的幻觉评估

人工智能 2026-05-26 v2

摘要

诊断深度研究代理(DRA)的失败模式 remains a critical challenge。现有基准主要依赖端到端评估,掩盖了在研究轨迹中不断积累的中间幻觉。为弥合这一差距,我们提出从结果为导向转向过程导向的评估方法,通过审计全计划-搜索-总结轨迹中的幻觉。我们提出PING分类法,将DRA幻觉分为四种互补类型:传播型、意图型、噪声诱导型和锚定型.我们进一步将此分类法实例化为细粒度评估框架,将轨迹分解为原子动作、主张和子查询进行严格验证。利用该框架隔离100个明确易产生幻觉的任务,包括对抗情景,我们策划了DeepHalluBench。对六个代表性DRA进行实验表明,在我们的幻觉易感stress-test集合上,所有评估的系统仍显示出不可忽视的可靠性差距。此外,我们的诊断分析将这些失败归因于系统性缺陷,尤其是幻觉传播和认知偏差,为未来的架构优化提供可操作见解。代码和数据已发布于https://github.com/yuhao-zhan/DeepHalluBench。

关键词

引用

@article{arxiv.2601.22984,
  title  = {Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory},
  author = {Yuhao Zhan and Tianyu Fan and Linxuan Huang and Zirui Guo and Chao Huang},
  journal= {arXiv preprint arXiv:2601.22984},
  year   = {2026}
}