VRAG-RL:通过强化学习迭代推理赋能基于视觉感知的 RAG 以理解视觉富信息
计算与语言
2025-06-04 v2 人工智能
计算机视觉与模式识别
摘要
有效地检索、推理和理解视觉富信息对 RAG 方法而言仍是一项挑战。传统的基于文本的方法无法处理视觉相关信息。另一方面,当前的基于视觉的 RAG 方法常受限于固定流水线,且由于模型基础能力未被充分激活,往往难以有效推理。鉴于强化学习(RL)已被证明有益于模型推理,我们引入 VRAG-RL,一种专为视觉富信息复杂推理量身定制的新型 RL 框架。通过该框架,视觉语言模型(VLM)与搜索引擎交互,在视觉感知 token 的辅助下自主采样单轮或多轮推理轨迹,并基于这些样本进行持续优化。我们的方法突出了 RL 在 RAG 领域的关键局限: 先前的多模态 RAG 方法倾向于仅将图像纳入上下文,导致推理 token 分配不足并忽略视觉特定感知; 当模型与搜索引擎交互时,由于无法清晰表达需求,其查询常无法检索到相关信息,从而导致次优性能。为应对这些挑战,我们定义了专为视觉富输入量身定制的动作空间,动作包括裁剪和缩放,允许模型从粗到细的视角收集信息。此外,为弥合用户原始查询与检索器之间的差距,我们采用了一种简单而有效的奖励机制,将查询重写和检索性能与基于模型的奖励相结合。我们的 VRAG-RL 使用专门设计的 RL 策略优化 VLM 以执行 RAG 任务,使模型与实际应用相契合。代码可在 https://github.com/Alibaba-NLP/VRAG 获取。
引用
@article{arxiv.2505.22019,
title = {VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning},
author = {Qiuchen Wang and Ruixue Ding and Yu Zeng and Zehui Chen and Lin Chen and Shihang Wang and Pengjun Xie and Fei Huang and Feng Zhao},
journal= {arXiv preprint arXiv:2505.22019},
year = {2025}
}