通过自洫抽样提升 MLLM outcome-reward RL 训练效果
计算机视觉与模式识别
2025-11-14 v1
摘要
结果奖励强化学习(RL)是细化多模态大语言模型(MLLMs)逐步推理的常见且日益重要方式。在多选设置——这是多模态推理基准的主导格式——该范式面临一个显著且常被忽视的障碍:不忠诚的轨迹在错误的思考链后猜中正确选项,仍获得与真实推理相同的奖励,这是一个无法忽视的缺陷。我们提出自洫抽样(SCS)来纠正此问题。对于每个问题,SCS (i) 引入小幅视觉扰动, (ii) 对初始轨迹执行多次截断和重抽样;结果轨迹之间的一致性为可微分的一致性得分,用于在策略更新期间降低不可靠轨迹的权重。基于 Qwen2.5-VL-7B-Instruct,将 SCS 插入 RLOO、GRPO 和 REINFORCE++ 系列,可在六个多模态基准上提升最高达 7.7 个百分点的准确率,额外计算开销可忽略不计。SCS 也在 Qwen2.5-VL-3B-Instruct 和 InternVL3-8B 上取得显著提升,为 MLLM 的结果奖励 RL 提供简单、通用的解决方案。
引用
@article{arxiv.2511.10648,
title = {Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling},
author = {Jiahao Wang and Weiye Xu and Aijun Yang and Wengang Zhou and Lewei Lu and Houqiang Li and Xiaohua Wang and Jinguo Zhu},
journal= {arXiv preprint arXiv:2511.10648},
year = {2025}
}
备注
Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)