中文

基于感知证据锚定的强化学习用于多模态推理

计算机视觉与模式识别 2025-11-25 v1

摘要

基于可验证奖励的强化学习(RLVR)已显著提升了大语言模型(LLMs)的推理能力,正在应用于视觉语言模型(VLMs)。然而,纯粹的 RLVR 仅验证最终文本输出,严重忽略了视觉感知这一基础步骤。这导致视觉幻觉和奖励作弊,因为以错误感知为基础的推理本质上不可靠。为此,我们提出 PEARL(Perceptual-Evidence Anchored Reinforced Learning),一种双分支感知-推理协同机制,通过显式锚定可验证的视觉证据来强化多模态推理。对于每个以推理为导向的 QA 实例,PEARL 首先推导感知检查清单——一组具有可验证答案的感知子问题,用于探测模型对关键视觉证据的理解。在训练期间,针对该检查清单的辅助 rollout 产生感知奖励,既直接强化模型的感知能力,也作为推理的保真门控。若模型通过感知检查,其策略更新将偏向基于证据的推理;否则,将停止过程以防止基于错误前提的推理。PEARL 可无缝集成到诸如 GRPO 和 DAPO 等流行 RL 方法中。全面实验表明,PEARL 在多模态推理基准测试中实现显著提升,例如在 MathVerse 上相对于基线提升 +9.7%,相对于 GRPO 提升 +6.6%。

关键词

引用

@article{arxiv.2511.18437,
  title  = {Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning},
  author = {Chi Zhang and Haibo Qiu and Qiming Zhang and Yufei Xu and Zhixiong Zeng and Siqi Yang and Peng Shi and Lin Ma and Jing Zhang},
  journal= {arXiv preprint arXiv:2511.18437},
  year   = {2025}
}