UniDoc-RL:基于层次动作与稠密奖励的粗到细视觉RAG
计算机视觉与模式识别
2026-04-20 v2 人工智能
摘要
检索增强生成(RAG)将外部视觉知识扩展到大规模视觉语言模型(LVLMs),但现有视觉RAG系统通常依赖通用检索信号,忽视复杂推理所必需的细粒度视觉语义。为此,我们提出 UniDoc-RL——一个统一的强化学习框架,使 LVLM 智能体联合执行检索、重排序、主动视觉感知和推理。UniDoc-RL 将视觉信息获取建模为具有层次动作空间的序列决策问题。具体而言,它从粗粒度文档检索逐步细化到精细的图像选择和主动区域裁切,允许模型抑制无关内容并聚焦于信息密集区域。为实现端到端训练,我们引入稠密多奖励方案,为每个动作提供任务感知的监督。基于组相对策略优化(GRPO),UniDoc-RL 在无需独立价值网络的情况下将智能体行为与多个目标对齐。为支持此训练范式,我们构建了包含高质量推理轨迹并具备细粒度动作注释的综合数据集。三个基准实验表明,UniDoc-RL consistently 优于最新基线方法,相较于先前基于RL的方法实现最高17.7%的提升。
引用
@article{arxiv.2604.14967,
title = {UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards},
author = {Jun Wang and Shuo Tan and Zelong Sun and Tiancheng Gu and Yongle Zhao and Ziyong Feng and Kaicheng Yang and Zhiwu Lu},
journal= {arXiv preprint arXiv:2604.14967},
year = {2026}
}
备注
17 pages, 11 figures