中文

噪声校正的 GRPO:从噪声奖励到无偏梯度

机器学习 2026-05-20 v3 人工智能

摘要

从人类反馈获得强化学习(RLHF)或可验证奖励(RLVR)是对齐大语言模型(LLM)或构建最近 SOTA 推理模型的标准范式,因对不一致或错误奖励带来的噪声高度敏感。然而,这种噪声与广泛使用的基于群体的策略优化方法之间的相互作用仍未得到充分探讨。我们引入一种面向噪声鲁健的群体相对策略优化(GRPO)和 Done Right GRPO(Dr.GRPO)框架,显式地将奖励损坏建模为伯努利噪声。该方法通过估计奖励翻转概率进行噪声校正,以消除学习信号的偏差,从而得到可证明的无偏梯度估计。理论分析表明,基于群体的方法本质上能减轻个体层面的噪声,而我们的校正策略放大了这种鲁健性。实验结果表明,在应用于标准奖励模型使用情境时,我们的方法在数学和代码任务上均实现了持续的改进,特别是在数学任务上准确率提升最高可达 6.7 个百分点,在代码任务上提升 1.5 个百分点。本工作将监督学习中的标签噪声校正与现代 RLHF 结合起来,提供了理论洞察和实用算法,适用于噪声较大的实际场景部署。

关键词

引用

@article{arxiv.2510.18924,
  title  = {Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients},
  author = {Omar El Mansouri and Fathinah Asma Izzati and Mohamed El Amine Seddik and Salem Lahlou},
  journal= {arXiv preprint arXiv:2510.18924},
  year   = {2026}
}