中文

未来KL正则化GRPO:基于$f$-散度正则化的过程级信用分配

机器学习 2026-05-26 v2 人工智能 计算与语言

摘要

组相对策略优化(GRPO)被广泛用于无评论家的大型语言模型(LLM)后训练,但其KL正则化通常作为局部损失侧的token惩罚来实现。我们表明,这遗漏了由自回归KL正则化诱导的策略梯度信号。与标准的KL正则化强化学习(RL)目标不同,GRPO的组归一化诱导了一个非线性的提示级效用;对于二元验证器奖励,该效用为2arcsinp2\arcsin\sqrt p。因此,在归一化之前,奖励和KL不能在改变隐式目标的情况下融合。我们推导了具有逐token ff-散度正则化的GRPO风格目标的on-policy梯度。奖励项恢复了标准化的GRPO优势,而正则化项包括一个由局部KL损失遗漏的因果未来正则化return-to-go。对于反向KL,这产生了一个简单的未来KL修正:在优势构建后,添加逐token对数比的反向累积和。由此产生的方法,未来KL正则化策略优化(FRPO),不需要评论家或额外的模型前向传递。在数学推理任务上,FRPO在我们的主要大模型设置中提高了pass@16,同时保持了比传统损失侧KL基线更高的熵和更低的策略漂移。

关键词

引用

@article{arxiv.2601.10201,
  title  = {Future-KL Regularized GRPO: Process-Level Credit Assignment from $f$-Divergence Regularization},
  author = {Jiarui Yao and Ruida Wang and Hao Bai and Tong Zhang},
  journal= {arXiv preprint arXiv:2601.10201},
  year   = {2026}
}