中文

RLHF中的能量损失现象:缓解奖励钻 Hollow 的新视角

机器学习 2025-06-03 v3

摘要

本工作识别了强化学习从人类反馈(RLHF)中的能量损失现象及其与奖励钻 Hollow 之间的关联。具体而言,在大型语言模型(LLM)最终层的能量损失在RL过程中逐渐增加,过度的能量损失增长可表征为奖励钻 Hollow。除了经验性分析外,我们进一步通过在适度条件下证明,增加的能量损失会降低大型语言模型中情境相关性的上界,这是奖励钻 Hollow 的关键方面,因为减少的情境相关性通常表明模型对奖励模型偏好的模式进行过拟合。为解决此问题,我们提出了一种能量损失感知PPO算法(EPPO),该算法在奖励计算时对大型语言模型最终层的能量损失增加进行惩罚,以防止能量损失的过度增加,从而缓解奖励钻 Hollow。我们理论上表明,EPPO可概念性地解释为一种熵正则化的强化学习算法,这提供了对其有效性的更深入见解。广泛的实验在各种大型语言模型和任务上表明,能量损失现象具有普遍性,EPPO在缓解奖励钻 Hollow 和提高RLHF性能方面效果显著。

关键词

引用

@article{arxiv.2501.19358,
  title  = {The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking},
  author = {Yuchun Miao and Sen Zhang and Liang Ding and Yuqi Zhang and Lefei Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2501.19358},
  year   = {2025}
}

备注

The paper has been accepted by ICML 2025