中文

奖励偏移与裁剪 KL 正则化下 RLHF 的通用性

机器学习 2026-02-26 v1 人工智能 机器学习

摘要

强化学习从人类反馈(RLHF)在大型语言模型的对齐和适应方面发挥着重要作用;然而,尤其是在学习奖励可能偏移且 KL 控制被估计并裁剪的情况下,其通用性理论理解仍显不足。为此,我们发展了一种明确 accounting(1)奖励偏移:奖励模型是在早期或混合行为策略的偏好数据上训练的,而 RLHF 在自身 rollout 上优化当前策略;以及(2)裁剪 KL 正则化:KL 正则化器是从抽样对数概率比中估计的,然后进行裁剪以稳定,导致对 RLHF 的误差。我们提出了 RLHF 的通用性界限,表明通用性误差源于来自提示和 rollout 的抽样误差、奖励偏移误差和 KL 裁剪误差。我们还讨论了两种特殊情况:(1) 以均匀先前在有限空间上的初始 RLHF 参数;(2) 以 Ornstein-Uhlenbeck 过程进行 RLHF 的随机梯度下降。该理论产生了在 (1) 最优 KL 裁剪阈值和 (2) 提示、rollout 和偏好数据方面的预算分配方面的实用含义。

关键词

引用

@article{arxiv.2602.21765,
  title  = {Generalisation of RLHF under Reward Shift and Clipped KL Regularisation},
  author = {Kenton Tang and Yuzhu Chen and Fengxiang He},
  journal= {arXiv preprint arXiv:2602.21765},
  year   = {2026}
}