中文

具有可验证奖励的强化学习:GRPO 的有效损失、动力学与成功放大

机器学习 2025-10-22 v4 机器学习

摘要

组相对策略优化最近被引入并用于在可验证(二值)奖励下促进 LLM 的推理能力。我们证明,对这些奖励进行均值+方差校准会诱导出一种加权对比损失,其中对比样本是从先前策略中提取的合成数据。虽然 GRPO 最初与裁剪配对以使更新靠近旧策略,但我们分析了在奖励归一化(仅均值与均值+方差)以及使用 KL 散度正则化更新的方式上有所不同的变体:要么惩罚与先前模型的散度,要么惩罚与固定参考模型 πref\pi_{\mathrm{ref}} 的散度,亦或结合两种正则化形式。对于每种变体,最优策略 πn\pi_n 均可表示为关于二值奖励、πn1\pi_{n-1} 下奖励的一阶与二阶统计量以及策略 πn1\pi_{n-1}πref\pi_{\mathrm{ref}} 的显式形式。迭代此过程会产生一个序列 {πn}\{\pi_n\},其成功概率服从一个简单的递推关系,并收敛至由参考 PoS 与正则化强度决定的不动点。我们进一步证明该不动点超过参考值,表明 GRPO 放大了策略的成功概率。

关键词

引用

@article{arxiv.2503.06639,
  title  = {Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification},
  author = {Youssef Mroueh},
  journal= {arXiv preprint arXiv:2503.06639},
  year   = {2025}
}