中文

用于缓解 RLHF 中的奖励钻孔的奖励塑形

机器学习 2026-01-22 v5 人工智能 计算与语言

摘要

从人类反馈中进行强化学习 (RLHF) 是实现大型语言模型 (LLM) 与人类价值观一致性的关键手段。然而,RLHF 易受到奖励钻孔 (reward hacking) 的威胁,即智能体利用奖励函数中的漏洞而非学习预期行为,从而降低对齐效果。尽管奖励塑形有助于稳定 RLHF 并部分缓解奖励钻孔,但系统性地探讨塑形技术及其背后原理仍缺乏。为弥合这一差距,本文对常见的奖励塑形方法进行了全面研究。我们的分析表明,两个关键设计原则:(1) RL 奖励应受限;(2) RL 奖励有利于快速初始增长后逐渐收敛。基于这些洞见,我们提出了一种新颖方法,即 Preference As Reward (PAR),该方法利用奖励模型中内嵌的潜在偏好作为强化学习信号。此外,PAR 还具有两个关键的方差降低特性,有助于稳定 RLHF 训练过程,并有效延长对 early stopping 的容忍窗口。我们在 base model Gemma2-2B 上进行评估,使用两个数据集,Ultrafeedback-Binarized 和 HH-RLHF。实验结果表明,PAR 在其他奖励塑形方法中表现优异。在 AlpacaEval 2.0 基准测试中,PAR 的胜率至少高出 5 个百分点。此外,PAR 具有显著的数据效率,仅需一个参考奖励即可实现最佳性能,并且在经过两个完整训练周期后仍能保持对奖励钻孔的鲁健性。代码已公开于 https://github.com/PorUna-byte/PAR。

关键词

引用

@article{arxiv.2502.18770,
  title  = {Reward Shaping to Mitigate Reward Hacking in RLHF},
  author = {Jiayi Fu and Xuandong Zhao and Chengyuan Yao and Heng Wang and Qi Han and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2502.18770},
  year   = {2026}
}