MSRL:通过多阶段强化学习扩展生成式多模态奖励建模
计算机视觉与模式识别
2026-03-27 v1
摘要
近期进展主要基于从判别式向生成式方法的范式转变来推动多模态奖励建模。基于这一进展,近期研究进一步采用基于可验证奖励的强化学习(RLVR)来增强多模态奖励模型(MRM)。尽管这些方法取得了成功,但RLVR-based训练通常依赖于标注的多模态偏好数据,而标注成本高昂且耗时,使得规模化MRM训练困难。为克服这一限制,我们提出了一种多阶段强化学习(MSRL)方法,能够以有限的多模态数据实现可规模化的RL。MSRL通过三个阶段取代传统的RLVR训练范式:首先从大规模文本偏好数据中学习通用可解释的奖励推理能力,然后通过基于标题的和完全多模态的强化学习阶段逐步将此能力迁移到多模态任务。此外,我们引入一种跨模态知识蒸馏方法以提高偏好在MSRL中的泛化能力。广泛的实验表明,MSRL有效地扩展了生成式MRM的RLVR训练,显著提升了其在视觉理解和视觉生成任务上的性能(例如,在VL-RewardBench上从66.6%提升至75.9%,在GenAI-Bench上从70.2%提升至75.7%),且无需额外的多模态偏好标注。我们的代码可在:https://github.com/wangclnlp/MSRL 获取。
引用
@article{arxiv.2603.25108,
title = {MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning},
author = {Chenglong Wang and Yifu Huo and Yang Gan and Qiaozhi He and Qi Meng and Bei Li and Yan Wang and Junfu Liu and Tianhua Zhou and Jingbo Zhu and Tong Xiao},
journal= {arXiv preprint arXiv:2603.25108},
year = {2026}
}
备注
Accepted by CVPR 2026