中文

Skywork R1V2:基于混合强化学习的多模态推理模型

计算机视觉与模式识别 2025-06-09 v4

摘要

我们提出了 Skywork R1V2,这是一个下一代多模态推理模型,是其前身 Skywork R1 的重要进步。R1V2 的核心引入了混合强化学习范式,联合利用混合偏好优化(Mixed Preference Optimization, MPO)和群相对策略优化(Group Relative Policy Optimization, GRPO),将奖励模型引导与基于规则的策略相融合,从而解决长期以来平衡高级推理能力与广泛泛化能力之间的难题。为进一步提升训练效率,我们提出了选择性样本缓冲区(Selective Sample Buffer, SSB)机制,通过在优化过程中优先保留高价值样本,有效缓解了 GRPO 中优势消失的困境。值得注意的是,我们观察到过度的强化信号会诱发视觉幻觉,这一现象我们通过在训练过程中系统性地监控并施加校准的奖励阈值来予以缓解。经验结果表明,R1V2 在多个基准上均取得领先水平,如在 OlympiadBench 上的 62.6、AIME2024 上的 78.9、LiveCodeBench 上的 63.6 以及 MMMU 上的 73.6。这些结果凸显了 R1V2 在现有开源模型中的卓越能力,同时在与顶尖专有系统(包括 Gemini 2.5 和 OpenAI-o4-mini)的性能差距方面取得了显著进步。Skywork R1V2 模型权重已公开发布以促进开放性和可重复性,详见 https://huggingface.co/Skywork/Skywork-R1V2-38B。

关键词

引用

@article{arxiv.2504.16656,
  title  = {Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning},
  author = {Peiyu Wang and Yichen Wei and Yi Peng and Xiaokun Wang and Weijie Qiu and Wei Shen and Tianyidan Xie and Jiangbo Pei and Jianhao Zhang and Yunzhuo Hao and Xuchen Song and Yang Liu and Yahui Zhou},
  journal= {arXiv preprint arXiv:2504.16656},
  year   = {2025}
}