具有可验证奖励的强化学习:GRPO 的有效损失、动力学与成功放大
机器学习
2025-10-22 v4 机器学习
摘要
组相对策略优化最近被引入并用于在可验证(二值)奖励下促进 LLM 的推理能力。我们证明,对这些奖励进行均值+方差校准会诱导出一种加权对比损失,其中对比样本是从先前策略中提取的合成数据。虽然 GRPO 最初与裁剪配对以使更新靠近旧策略,但我们分析了在奖励归一化(仅均值与均值+方差)以及使用 KL 散度正则化更新的方式上有所不同的变体:要么惩罚与先前模型的散度,要么惩罚与固定参考模型 的散度,亦或结合两种正则化形式。对于每种变体,最优策略 均可表示为关于二值奖励、 下奖励的一阶与二阶统计量以及策略 和 的显式形式。迭代此过程会产生一个序列 ,其成功概率服从一个简单的递推关系,并收敛至由参考 PoS 与正则化强度决定的不动点。我们进一步证明该不动点超过参考值,表明 GRPO 放大了策略的成功概率。
引用
@article{arxiv.2503.06639,
title = {Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification},
author = {Youssef Mroueh},
journal= {arXiv preprint arXiv:2503.06639},
year = {2025}
}