中文

R1-Reward:通过稳定强化学习训练多模态奖励模型

计算机视觉与模式识别 2025-05-12 v2 计算与语言

摘要

多模态奖励模型(MRMs)在提升多模态大语言模型(MLLMs)性能方面发挥着关键作用。尽管近期进展主要集中在改进 MRMs 的模型结构和训练数据上,但对于奖励建模中长程推理能力的有效性以及如何激活 MRMs 中的这些能力,探索仍然有限。本文探讨了如何利用强化学习(RL)来改进奖励建模。具体而言,我们将奖励建模问题重新表述为一个基于规则的 RL 任务。然而,我们观察到,由于现有 RL 算法(如 Reinforce++)的固有局限性,直接将其应用于奖励建模往往会导致训练不稳定甚至崩溃。为解决此问题,我们提出了 StableReinforce 算法,该算法改进了现有 RL 方法的训练损失、优势估计策略和奖励设计。这些改进带来了更稳定的训练动态和更优越的性能。为促进 MRM 训练,我们从多个数据集中收集了 20 万条偏好数据。我们的奖励模型 R1-Reward 在此数据集上使用 StableReinforce 算法进行训练,在多模态奖励建模基准上显著提升了性能。与先前的最先进模型相比,R1-Reward 在 VL Reward-Bench 上取得了 8.4% 的提升,在 Multimodal Reward Bench 上取得了 14.3% 的提升。此外,随着推理计算量的增加,R1-Reward 的性能得到进一步增强,凸显了 RL 算法在优化 MRMs 方面的潜力。

关键词

引用

@article{arxiv.2505.02835,
  title  = {R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning},
  author = {Yi-Fan Zhang and Xingyu Lu and Xiao Hu and Chaoyou Fu and Bin Wen and Tianke Zhang and Changyi Liu and Kaiyu Jiang and Kaibing Chen and Kaiyu Tang and Haojie Ding and Jiankang Chen and Fan Yang and Zhang Zhang and Tingting Gao and Liang Wang},
  journal= {arXiv preprint arXiv:2505.02835},
  year   = {2025}
}

备注

Home page: https://github.com/yfzhang114/r1_reward