关于组相对深度强化学习优化中负梯度的影响
机器学习
2025-05-27 v1 计算与语言
摘要
强化学习 (RL) 由于在提升大型语言模型 (LLM) 推理能力方面取得显著成果,近期广泛采用于 Group Relative Policy Optimization (GRPO) 等算法。尽管 GRPO 已被广泛采用,但我们发现一种称为空概率位移 (Lazy Likelihood Displacement, LLD) 的先前未被识别的现象,即在训练过程中正确响应的概率仅略有增加甚至会下降。这一行为类似于 Direct Preference Optimization (DPO) 中最近发现的误对齐问题,后者归因于负梯度的影响。我们对 GRPO 的学习动力学进行了理论分析,识别出 LLD 来源于对错误响应中所有标记统一惩罚力度过大。为此,我们发展了一种称为 NTHR 的方法,通过对贡献 LLD 的标记进行权重下调来减轻惩罚。不同于先前基于 DPO 的方法,NTHR 充分利用了 GRPO 的基于组的结构,以正确响应作为锚点来识别具有影响力的标记。在数学推理基准测试中进行的实验表明,NTHR 有效缓解了 LLD,在参数规模从 0.5B 到 3B 的模型上均实现了持续的性能提升。
引用
@article{arxiv.2505.18830,
title = {On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization},
author = {Wenlong Deng and Yi Ren and Muchen Li and Danica J. Sutherland and Xiaoxiao Li and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2505.18830},
year = {2025}
}