面向 LLM 推理的 KL 正则化策略梯度算法设计
摘要
策略梯度算法已成功应用于增强大语言模型(LLM)的推理能力。KL 正则化无处不在,但其设计空间、KL 方向的选择(前向 vs. 反向)、归一化方式(归一化 vs. 非归一化)以及估计器()在文献中分散存在,且常与离线策略估计交织在一起。我们聚焦一个问题:在离线策略设定下,每个 KL 变体需要何种加权,才能使所优化的替代目标精确给出所期望的 KL 正则化目标的梯度?我们通过一个紧凑的统一推导——即正则化策略梯度(RPG)视角——回答了该问题。RPG(i)统一了归一化与非归一化 KL 变体,并表明广泛使用的 惩罚项恰好对应非归一化 KL;(ii)指出了带停止梯度的 REINFORCE 风格损失与完全可微分替代目标梯度等价的条件;(iii)识别并修正了 GRPO 中 KL 项的离线策略重要性加权不匹配问题;(iv)提出了 RPG-Style Clip,即在 RPG-REINFORCE 中引入裁剪重要性采样步骤,使大规模离线策略策略梯度训练更加稳定。在数学推理基准(AIME24、AIME25)上,RPG-REINFORCE 配合 RPG-Style Clip 相比 DAPO 准确率提升了最多 6 个百分点。我们将实验扩展至 8K 上下文长度,RPG-REINFORCE 配合 RPG-Style Clip 在 AIME25 上达到 52% 准确率,超越了官方 Qwen3-4B-Instruct 模型(47%)。值得注意的是,RPG 是一个稳定且可扩展的 LLM 推理 RL 算法,通过(a)KL 正确的目标、(b)裁剪重要性采样和(c)迭代参考策略更新方案实现。项目页面:https://github.com/complex-reasoning/RPG。
引用
@article{arxiv.2505.17508,
title = {On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning},
author = {Yifan Zhang and Yifeng Liu and Huizhuo Yuan and Yang Yuan and Quanquan Gu and Andrew Chi-Chih Yao},
journal= {arXiv preprint arXiv:2505.17508},
year = {2026}
}
备注
Published in ICLR 2026; Project Page: https://github.com/complex-reasoning/RPG