中文

重构 RLHF 中的 KL 正则化:从价值估计到梯度优化

机器学习 2025-10-07 v2 人工智能

摘要

强化学习从人类反馈(RLHF)利用KL散度损失以稳定训练并防止过拟合。然而,在诸如GRPO等方法中,其实现方式可能受数值价值估计原则的指导,忽视了该术语作为优化损失的功能角色。为分析此问题,我们建立了一个统一框架,将两种看似distinct的实现风格联系起来:将数学项knk_n作为策略得分函数的独立系数(‘knk_n in reward’)或通过其梯度传递的直接损失函数(‘knk_n as loss’)。我们表明,后者可通过前者中的等效梯度系数进行分析,统一了两种视角。在此框架下,我们证明常用的'k1k_1 in reward'(如PPO)是Reverse KL(RKL)正则化的原则损失。我们进一步确立了一个关键发现:在on-policy条件下,'k2k_2 as loss'的表述实际上与'k1k_1 in reward'在梯度上等价。这一等价性首次在我们工作中得到证明,确定了两种作为RKL目标的原则实现。在 contrast,我们表明最近采用'k3k_3 as loss'(如GRPO)仅是原则损失的一次级、有偏近似。此外,我们认为常见的off-policy实现'knk_n as loss'方法因忽略重要性抽样而具有偏差,并提出了原则性纠正。我们的发现为选择和正确实现KL正则化提供了全面的梯度依据,为更稳健、有效的RLHF系统之路。

关键词

引用

@article{arxiv.2510.01555,
  title  = {Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization},
  author = {Kezhao Liu and Jason Klein Liu and Mingtao Chen and Yiming Liu},
  journal= {arXiv preprint arXiv:2510.01555},
  year   = {2025}
}