中文

多模态推理的稳定高效单轨迹强化学习

机器学习 2025-12-23 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

基于可验证奖励的强化学习(RLVR)已成为提高多模态大语言模型(MLLMs)推理能力的关键范式。然而,常见的基于组的算法如GRPO需要为每个提示进行多轨迹抽样。虽然近期在文本专用设置中探索了更高效的单轨迹变体,但我们发现它们在多模态上下文中常常严重不稳定,导致训练崩溃。为解决训练效率与稳定性之间的权衡,我们引入MSSR\textbf{MSSR}(Multimodal Stabilized Single-Rollout),一种无组别的RLVR框架,实现稳定优化与有效多模态推理性能。MSSR通过熵基优势塑形机制实现此目标,通过自适应正则化优势幅度,防止崩溃并维持训练稳定性。虽然此类机制在基于组的RLVR中已有使用,但我们表明在多模态单轨迹设置中它们不仅有益而且是稳定性的必需品。在分布内评估中,MSSR显示出优越的训练计算效率,以半数的训练步数实现与基于组的基线相似的验证准确率。训练相同步数后,MSSR的性能超越基于组的基线,并在五个多样化推理密集型基准测试中表现出一致的泛化改进。综上,这些结果表明MSSR实现了稳定、计算高效且有效的多模态推理RLVR。

关键词

引用

@article{arxiv.2512.18215,
  title  = {Stable and Efficient Single-Rollout RL for Multimodal Reasoning},
  author = {Rui Liu and Dian Yu and Lei Ke and Haolin Liu and Yujun Zhou and Zhenwen Liang and Haitao Mi and Pratap Tokekar and Dong Yu},
  journal= {arXiv preprint arXiv:2512.18215},
  year   = {2025}
}