中文

Perception-R1:通过视觉感知奖励提升多模态大语言模型的感知推理能力

机器学习 2026-03-04 v3 人工智能 计算机视觉与模式识别

摘要

提升多模态大语言模型(MLLMs)的多模态推理能力是一个备受关注的挑战性任务。最近几项研究尝试应用基于可验证奖励的强化学习(RLVR)于多模态领域,以增强MLLMs的推理能力。然而,这些工作大体上忽视了对MLLMs多模态感知能力的提升,而感知能力是复杂多模态推理的核心前提和基础组件。通过McNemar检验,我们发现现有的RLVR方法未能有效提升MLLMs的多模态感知能力,从而限制了其在多模态推理中的进一步提升。为此,我们提出Perception-R1,引入新颖的视觉感知奖励,显式鼓励MLLMs准确感知视觉内容,从而有效激励其多模态感知和推理能力。具体而言,我们首先收集来自多模态问题的CoT轨迹中的文本视觉注释,作为视觉参考用于奖励分配。在RLVR训练期间,我们采用判定LLM来评估视觉注释与MLLM生成响应之间的一致性,并据此分配视觉感知奖励。在几个多模态推理基准测试上的大量实验表明,Perception-R1的有效性,仅使用1,442个训练数据即可在大多数基准测试上实现最先进的性能。我们的代码和数据集将在https://github.com/tongxiao2002/Perception-R1提供。

关键词

引用

@article{arxiv.2506.07218,
  title  = {Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward},
  author = {Tong Xiao and Xin Xu and Zhenya Huang and Hongyu Gao and Quan Liu and Qi Liu and Enhong Chen},
  journal= {arXiv preprint arXiv:2506.07218},
  year   = {2026}
}