中文

超越单次写作:深度研究智能体在多轮报告修订中不可靠

计算与语言 2026-01-21 v1 人工智能

摘要

现有的深度研究智能体 (DRA) 基准测试将报告生成视为单次写作任务,这与人类研究人员通过自我反思或同行反馈迭代起草和修订报告的方式存在根本分歧。DRA 能否根据用户反馈可靠地修订报告仍未被探索。我们引入了 Mr Dre,这是一个为 DRA 建立多轮报告修订作为新评估轴的评估套件。Mr Dre 包含:(1) 涵盖全面性、事实性和呈现方式的统一长篇报告评估协议,以及 (2) 用于多轮修订的经人工验证的反馈模拟流水线。我们对五个不同的 DRA 的分析揭示了一个关键局限:尽管智能体能够处理大部分用户反馈,但它们也会在 16-27% 的先前已涵盖内容和引用质量上出现倒退。在多轮修订中,即使是表现最好的智能体也留有显著的改进空间,因为它们持续破坏反馈范围之外的内容,且未能保留先前的编辑。我们进一步表明,这些问题无法通过推理时的修复手段(如提示工程和专用的报告修订子智能体)轻易解决。

关键词

引用

@article{arxiv.2601.13217,
  title  = {Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision},
  author = {Bingsen Chen and Boyan Li and Ping Nie and Yuyu Zhang and Xi Ye and Chen Zhao},
  journal= {arXiv preprint arXiv:2601.13217},
  year   = {2026}
}