中文

超越SFT到RL:基于黑盒在线策略蒸馏的多模态强化学习预对齐

计算机视觉与模式识别 2026-05-05 v2 人工智能 计算与语言

摘要

大型多模态模型(LMMs)的标准后训练流程是在精选的演示数据上应用监督微调(SFT),然后进行带有可验证奖励的强化学习(RLVR)。然而,SFT引入了分布漂移,既不能保留模型的原始能力,也无法忠实地匹配监督分布。这个问题在多模态推理中进一步放大,其中感知错误和推理失败遵循不同的漂移模式,并在随后的强化学习中复合。我们引入了PRISM,一个三阶段流程,通过在SFT和RLVR之间插入一个显式的分布对齐阶段来缓解这种漂移。基于在线策略蒸馏(OPD)的原理,PRISM将对齐构建为一个黑盒、响应级别的对抗博弈,博弈双方是策略和一个由专家混合(MoE)构成的判别器,该判别器具有专门的感知和推理专家,提供解耦的校正信号,引导策略趋向监督分布,而无需访问教师logits。虽然126万公开演示足以用于广泛的SFT初始化,但分布对齐需要更高保真度的监督;因此,我们从Gemini 3 Flash中整理了额外的11.3万个演示,这些演示具有密集的视觉定位和对最难未解决问题的逐步推理。在Qwen3-VL上的实验表明,PRISM在多种强化学习算法(GRPO、DAPO、GSPO)和多样化的多模态基准测试中,持续提高了下游RLVR的性能,在4B和8B模型上,平均准确率分别比SFT到RLVR基线提高了+4.4和+6.0个百分点。我们的代码、数据和模型检查点已在https://github.com/XIAO4579/PRISM上公开。

关键词

引用

@article{arxiv.2604.28123,
  title  = {Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL},
  author = {Sudong Wang and Weiquan Huang and Xiaomin Yu and Zuhao Yang and Hehai Lin and Keming Wu and Chaojun Xiao and Chen Chen and Wenxuan Wang and Beier Zhu and Yunjian Zhang and Chengwei Qin},
  journal= {arXiv preprint arXiv:2604.28123},
  year   = {2026}
}