中文

Perception-R1:以强化学习驱动的感知策略先驱

计算机视觉与模式识别 2025-04-11 v1 计算与语言

摘要

受 DeepSeek-R1 成功的启发,我们探索了在 MLLM 后训练中利用基于规则的强化学习(RL)进行感知策略学习的潜力。尽管前景广阔,但我们最初的实验表明,通过 RL 引入思考过程并不能在所有视觉感知任务上始终带来性能提升。这促使我们深入探讨 RL 在视觉感知背景下的核心作用。在这项工作中,我们回归基础,探索 RL 对不同感知任务的影响。我们观察到,感知复杂性是决定 RL 有效性的主要因素。我们还观察到,奖励设计在进一步逼近模型感知上限方面起着至关重要的作用。为了利用这些发现,我们提出了 Perception-R1,一个在 MLLM 后训练期间使用 GRPO 的可扩展 RL 框架。借助标准的 Qwen2.5-VL-3B-Instruct,Perception-R1 在 RefCOCO+ 上提升了 +4.2%,在 PixMo-Count 上提升了 +17.9%,在 PageOCR 上提升了 +4.2%,并且首次在 COCO2017 val 上达到了 31.9% AP,为感知策略学习确立了强大的基线。

关键词

引用

@article{arxiv.2504.07954,
  title  = {Perception-R1: Pioneering Perception Policy with Reinforcement Learning},
  author = {En Yu and Kangheng Lin and Liang Zhao and Jisheng Yin and Yana Wei and Yuang Peng and Haoran Wei and Jianjian Sun and Chunrui Han and Zheng Ge and Xiangyu Zhang and Daxin Jiang and Jingyu Wang and Wenbing Tao},
  journal= {arXiv preprint arXiv:2504.07954},
  year   = {2025}
}

备注

Github page: https://github.com/linkangheng/PR1