NoisyRollout:通过数据增强强化视觉推理
计算机视觉与模式识别
2025-11-03 v4
摘要
近期强化学习 (RL) 的进展增强了视觉语言模型 (VLM) 的推理能力。然而,提高策略探索以更好地扩展测试时计算量的问题在很大程度上仍未得到探索。此外,VLM 仍在处理不完美的视觉感知方面存在挑战,这进而影响后续推理过程。我们引入 NoisyRollout,这是一种简单而有效的数据增强方法,通过混合来自干净图像和适度失真图像的训练轨迹来解决上述问题。该方法注入感知多样性,鼓励更好的策略探索,导致更稳健的推理。一种噪声退火方案逐渐减少失真强度,在训练早期促进探索,同时确保后期稳定。关键的是,我们的方法易于采用——不需额外训练成本,也无需修改 RL 目标。广泛的实验在 2 个不同的训练数据集上表明,NoisyRollout 在 5 个超出域的推理和感知基准测试中实现了开源 RL 调优模型的最先进性能。此外,我们在模型规模(7B 和 32B)、数据规模(从 1K 到 6K)和图像增强类型(高斯噪声和旋转)方面验证了 NoisyRollout 的有效性,凸显了其通用性和可扩展性。
引用
@article{arxiv.2504.13055,
title = {NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation},
author = {Xiangyan Liu and Jinjie Ni and Zijian Wu and Chao Du and Longxu Dou and Haonan Wang and Tianyu Pang and Michael Qizhe Shieh},
journal= {arXiv preprint arXiv:2504.13055},
year = {2025}
}
备注
NeurIPS 2025