中文

从探索到利用:基于熵的 RLVR 两阶段方法用于噪声容错的多模态大语言模型训练

机器学习 2026-03-31 v2 计算机视觉与模式识别

摘要

强化学习可验证奖励(RLVR)用于多模态大语言模型(MLLM)的训练高度依赖高质量的标记数据,而在实际场景中,这些数据往往稀缺且容易受到大量标注噪声的影响。现有的无监督 RLVR 方法,包括纯熵最小化,可能过度拟合到错误标签,从而限制了组相对策略优化(GRPO)中至关重要的奖励排序信号。为解决这些挑战并增强对噪声的容错性,我们提出了一种 novel 的两阶段、基于 token 的熵优化方法,用于 RLVR。该方法在训练期间动态地引导模型从探索转向利用。在初始的探索阶段,token 级别的熵最大化促进多样化和随机的输出生成,作为强大的正则化器,防止模型过早地收敛到噪声标签,确保足够的组内变异性,从而在 GRPO 中实现更可靠的奖励梯度估计。随着训练的进行,该方法转变为利用阶段,在此阶段,token 级别的熵最小化鼓励模型产生自信且确定性的输出,从而巩固已获取的知识并细化预测准确性。在实验方面,跨越三个 MLLM 主干网络——Qwen2-VL-2B、Qwen2-VL-7B 和 Qwen2.5-VL-3B,涵盖多种噪声设置和多个任务,我们的分阶段策略一致优于先前方法,通过统一和增强外部、内部和基于熵的方法,实现了稳健且优异的性能。

关键词

引用

@article{arxiv.2511.07738,
  title  = {From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training},
  author = {Donglai Xu and Hongzheng Yang and Yuzhi Zhao and Pingping Zhang and Jinpeng Chen and Wenao Ma and Zhijian Hou and Mengyang Wu and Xiaolei Li and Senkang Hu and Ziyi Guan and Jason Chun Lok Li and Lai Man Po},
  journal= {arXiv preprint arXiv:2511.07738},
  year   = {2026}
}