中文

Ground-R1:通过强化学习激励基于视觉证据的视觉推理

计算机视觉与模式识别 2026-02-04 v3

摘要

大型视觉语言模型(LVLMs)已成为强大的通用助手,但由于缺乏充分的视觉证据支撑,其预测往往缺乏可靠性与可解释性。新兴的“图像思考”范式试图通过将推理显式锚定到图像区域来解决这一问题。然而,我们通过实验发现,大多数现有方法在优化过程中存在系统性的尺度驱动偏差,即训练奖励被大视觉区域所主导,抑制了对小但语义关键的证据的学习,导致在推理时产生虚假的视觉定位。为解决这一局限性,我们提出了 Ground-R1,这是一个去偏的“图像思考”框架,通过一种新颖的尺度相对策略优化(SRPO)目标进行训练,以替代标准的 GRPO。具体而言,我们的 SRPO 通过尺度感知分箱以及箱内/箱间比较,重新校准了不同大小证据区域的奖励学习,从而在训练过程中实现平衡的信用分配。在通用 LVLM、高分辨率和视觉定位基准上的实验结果验证了 Ground-R1 的有效性,并表明 SRPO 在响应准确率和证据定位方面均比标准 GRPO 取得了一致的提升。

关键词

引用

@article{arxiv.2505.20272,
  title  = {Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning},
  author = {Meng Cao and Haoze Zhao and Can Zhang and Xiaojun Chang and Ian Reid and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2505.20272},
  year   = {2026}
}