中文

Deep-Reporter:面向有据可依的多模态长篇生成的深度研究

计算与语言 2026-04-21 v2 人工智能 信息检索

摘要

最近的智能体搜索框架通过迭代规划和检索实现深度研究,减少了幻觉并增强了事实依据。然而,它们仍然以文本为中心,忽略了表征现实世界专家报告的多模态证据。我们引入了一项紧迫的任务:多模态长篇生成。据此,我们提出了 Deep-Reporter,一个用于有据可依的多模态长篇生成的统一智能体框架。它协调了:(i) 智能体多模态搜索与过滤,用于检索和过滤文本段落及信息密集的视觉内容;(ii) 清单引导的增量式合成,以确保连贯的图文整合和最佳的引用位置;(iii) 循环上下文管理,以平衡长程连贯性与局部流畅性。我们开发了一个严格的整理流程,生成了 8000 条高质量智能体轨迹用于模型优化。我们进一步引入了 M2LongBench,一个包含 9 个领域 247 项研究任务的综合测试平台,以及一个稳定的多模态沙盒环境。大量实验表明,长文多模态生成是一项具有挑战性的任务,尤其是在多模态选择与整合方面,而有效的后训练可以弥合这一差距。

关键词

引用

@article{arxiv.2604.10741,
  title  = {Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation},
  author = {Fangda Ye and Zhifei Xie and Yuxin Hu and Yihang Yin and Shurui Huang and Shikai Dong and Jianzhu Bao and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2604.10741},
  year   = {2026}
}

备注

41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results