奖励不太可能的样本:超越分布锐化的 GRPO 提升
机器学习
2025-06-23 v2
摘要
强化学习正成为提升语言模型推理能力的主要驱动力。一个基本问题是,当前的强化学习算法——例如用于提升语言模型推理能力的事实上的标准算法群体相对策略优化(GRPO)——是否仅仅在基础模型已经能够解决的问题周围锐化了其分布。我们在形式定理证明的背景下调查了这个问题,该领域拥有完美的验证器。我们在 GRPO 中发现了一种退化的排名偏差,即高概率轨迹被强化,而罕见轨迹被忽略。这导致了分布锐化:模型可以用更少的样本解决某些问题,但其表现不如直接从原始模型中采样更多解决方案。为了克服 GRPO 的排名偏差,我们引入了不太可能奖励,这是一种明确提升罕见但正确解决方案权重的简单方法。我们表明,不太可能奖励减轻了排名偏差,并在合成和真实定理证明设置中提高了大范围 下的 pass@。我们还发现了排名偏差与一个看似平凡的超参数——每批次更新次数——之间的意外联系,这导致了第二种互补的缓解方法。我们将这些见解结合成一个用于形式定理证明的修订版 GRPO 训练方案,产生了一个开放流程,在 miniF2F-test 基准测试上取得了与 DeepSeek-Prover-V1.5-RL 相当的性能。我们在 https://github.com/AndreHe02/rewarding-unlikely-release 发布了我们的实现
引用
@article{arxiv.2506.02355,
title = {Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening},
author = {Andre He and Daniel Fried and Sean Welleck},
journal= {arXiv preprint arXiv:2506.02355},
year = {2025}
}