中文

MM-Doc-R1:通过多回合强化学习训练用于长文档视觉问答的智能体

计算与语言 2026-04-16 v1

摘要

传统的检索增强生成 (RAG) 系统在处理长文档上的复杂多跳查询时常常难以应对,因为其单次检索方式。我们引入 MM-Doc-R1,一个新型框架,采用智能体化、视觉感知的工作流程,以迭代信息发现与综合方式解决长文档视觉问答问题。为激励智能体的信息寻求能力,我们提出了基于相似性的策略优化 (SPO) 方法,解决了现有多回合强化学习 (RL) 算法如 GRPO 中的基线估计偏差问题。我们的核心洞见是:在多回合 RL 中,两个轨迹在语义上越相似,其共享基线估计就越准确。基于此,SPO 通过轨迹间奖励的相似性加权平均来计算更精确的基线,而不是像 GRPO 那样将初始状态的基线不当地应用于所有中间状态。这为我们的智能体提供了更稳定、更准确的学习信号,训练表现显著优于 GRPO。在 MMLongbench-Doc 基准上的实验表明,MM-Doc-R1 相较于先前基线提升了 10.4%。此外,SPO 在 Qwen3-8B 和 Qwen3-4B 上分别比 GRPO 提升 5.0% 和 6.1%,这些结果凸显了我们集成框架和新型训练算法在复杂长文档视觉问答领域取得突破性进展的有效性。

关键词

引用

@article{arxiv.2604.13579,
  title  = {MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning},
  author = {Jiahang Lin and Kai Hu and Binghai Wang and Yuhao Zhou and Zhiheng Xi and Honglin Guo and Shichun Liu and Junzhe Wang and Shihan Dou and Enyu Zhou and Hang Yan and Zhenhua Han and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2604.13579},
  year   = {2026}
}