收缩方差:强化学习可验证奖励的收缩基线
机器学习
2026-02-19 v2
摘要
可验证奖励的强化学习(RLVR)已成为一种强大的范式,用于通过如 GRPO 等策略梯度方法对大型推理模型(LRM)进行后训练。为稳定训练,这些方法通常通过对每个提示的经验均值进行减去来对轨迹奖励进行居中。统计上,这种居中作用作为控制变量(基线),降低了策略梯度估计器的方差。在实践中,使用从每个 batch 中每个提示的生成计算的经验均值来估计均值。以 Stein 悖论为动机,我们提出了结合 per-prompt 和 across-prompt 均值的收缩估计器,以提高 per-prompt 均值估计的准确性,尤其在 RLVR 典型的低生成 regime 下。理论上,我们构建了一个可证明能产生更低方差策略梯度估计器的收缩基线。该基线是标准 per-prompt 均值基线的即插即用替换方案,不需要额外的超参数或计算。实验上,收缩基线始终优于经验均值基线,产生更低方差的梯度更新并提高训练稳定性。
引用
@article{arxiv.2511.03710,
title = {Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards},
author = {Guanning Zeng and Zhaoyi Zhou and Daman Arora and Andrea Zanette},
journal= {arXiv preprint arXiv:2511.03710},
year = {2026}
}
备注
Preprint. Under Review