论基于群体的强化学习中隐藏的目标偏差
机器学习
2026-01-09 v1 人工智能
计算与语言
摘要
基于群体的强化学习方法,如群体相对策略优化(GRPO),如今被广泛用于大型语言模型的后训练。尽管取得了经验上的成功,但它们在奖励优化和底层训练目标之间存在结构性不匹配。在本文中,我们通过在统一的替代公式中研究 GRPO 风格的方法,对其进行了理论分析。这一视角揭示了影响所有被分析方法的重现性特性:(i) 非均匀的群体权重会在共享前缀令牌上引入系统性的梯度偏差;(ii) 与 AdamW 优化器的交互使得训练动态在很大程度上对奖励缩放不敏感;(iii) 在重复优化步骤下,优化器动量可以将策略更新推过预期的裁剪区域。我们相信,这些发现凸显了当前方法的基本局限性,并为未来公式的设计提供了原则性指导。
引用
@article{arxiv.2601.05002,
title = {On the Hidden Objective Biases of Group-based Reinforcement Learning},
author = {Aleksandar Fontana and Marco Simoni and Giulio Rossolini and Andrea Saracino and Paolo Mori},
journal= {arXiv preprint arXiv:2601.05002},
year = {2026}
}