中文

VLM-R$^3$:增强式多模态链式推理的数据区域识别、推理与精炼

计算机视觉与模式识别 2025-06-02 v2 人工智能

摘要

最近,基于推理的大型多模态语言模型(LLM)在生成长形式文本推理链方面取得了一定成功。然而,它们仍在需要动态迭代关注和回访视觉区域以实现文本推理与视觉证据精确对应复杂任务方面存在挑战。我们提出\textbf{VLM-R3^3}(\textbf{V}isual \textbf{L}anguage \textbf{M}odel with \textbf{R}egion \textbf{R}ecognition and \textbf{R}easoning),一个为 MLLM 赋予能力的框架:(i) 判断是否需要额外的视觉证据,(ii) 确定在图像中在何处进行 grounding,以及 (iii) 无缝地将相关子图像内容编入交替式链式推理。我们方法的核心是 \textbf{Region-Conditioned Reinforcement Policy Optimization (R-GRPO)},一种训练范式,对模型进行奖励,以选择信息丰富的区域、制定适当的转换(如裁剪、放大),并将所得视觉上下文整合到后续推理步骤中。为引导此策略,我们构建了一个规模适中但精心挑选的 Visuo-Lingual Interleaved Rationale (VLIR) 语料库,提供区域选择和文本依据的步骤级监督。在 MathVista、ScienceQA 等各类基准上的大量实验表明,VLM-R3^3 在零样本和少样本设置下在该领域树立了新标杆,最大提升集中在对细微空间推理或精细视觉线索提取的疑问上。

关键词

引用

@article{arxiv.2505.16192,
  title  = {VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought},
  author = {Chaoya Jiang and Yongrui Heng and Wei Ye and Han Yang and Haiyang Xu and Ming Yan and Ji Zhang and Fei Huang and Shikun Zhang},
  journal= {arXiv preprint arXiv:2505.16192},
  year   = {2025}
}