中文

NoisyGRPO:通过噪声注入与贝叶斯估计激励多模态思维链推理

计算机视觉与模式识别 2026-04-08 v3

摘要

强化学习在增强多模态大语言模型的通用思维链推理能力方面展现出潜力。然而,当应用于改进通用思维链推理时,现有强化学习框架通常难以泛化到训练分布之外。为解决此问题,我们提出NoisyGRPO,一个系统性的多模态强化学习框架,该框架将可控噪声引入视觉输入以增强探索,并通过贝叶斯框架显式建模优势估计过程。具体而言,NoisyGRPO通过以下方式改进强化学习训练:(1) 噪声注入探索策略:用高斯噪声扰动视觉输入,以鼓励在更广泛的视觉场景中进行探索;(2) 贝叶斯优势估计:将优势估计形式化为一个原则性的贝叶斯推断问题,其中注入的噪声水平作为先验,观测到的轨迹奖励作为似然。这种贝叶斯建模融合了两种信息源,以计算轨迹优势的鲁棒后验估计,有效引导多模态大语言模型偏好视觉上合理的轨迹而非含噪轨迹。在标准思维链质量、通用能力和幻觉基准上的实验表明,NoisyGRPO显著提升了泛化性和鲁棒性,尤其是在使用Qwen2.5-VL 3B等小型多模态大语言模型的强化学习设置中。项目页面见https://artanic30.github.io/project_pages/NoisyGRPO/。

关键词

引用

@article{arxiv.2510.21122,
  title  = {NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation},
  author = {Longtian Qiu and Shan Ning and Jiaxuan Sun and Xuming He},
  journal= {arXiv preprint arXiv:2510.21122},
  year   = {2026}
}

备注

Accepted by Neurips 2025, Project page is available at https://artanic30.github.io/project_pages/NoisyGRPO/