中文

DocR1:基于证据页面引导的GRPO用于多页面文档理解

计算机视觉与模式识别 2025-12-22 v3

摘要

多页面文档理解是多模态大语言模型(MLLMs)面临的重大挑战,因为它需要对跨页面进行细粒度视觉理解和多跳推理。虽然已有工作探索了利用强化学习(RL)来增强MLLMs中高级推理能力,但其在多页面文档理解上的应用仍受到忽视。本文引入DocR1,通过一种新颖的RL框架Evidence Page-Guided GRPO(EviGRPO)训练的MLLM。EviGRPO包含一种证据感知奖励机制,促进粗到细推理策略,引导模型首先检索相关页面再生成答案。该训练范式使我们能够在有限的监督下构建高质量模型。为支持这一目标,我们设计了两个阶段的标注流程和课程学习策略,基于此构建了两个数据集:EviBench是一个具有4800个示例的高质量训练集,以及ArxivFullQA,这是基于科学论文构建的8600个QA对的评估基准。广泛的实验表明,DocR1在多页面任务上实现了最先进的性能,同时在单页面基准测试中始终保持强劲的结果。

关键词

引用

@article{arxiv.2508.07313,
  title  = {DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding},
  author = {Junyu Xiong and Yonghui Wang and Weichao Zhao and Chenyu Liu and Bing Yin and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2508.07313},
  year   = {2025}
}