中文

面向稳定RLHF的信息论奖励建模:检测与缓解奖励入侵

机器学习 2025-10-16 v1

摘要

尽管强化学习从人类反馈(RLHF)在与人类价值观对齐方面取得了成功,但奖励入侵(reward hacking)或奖励过度优化仍是主要挑战。我们识别了两个关键缓解障碍:(1)奖励建模中的奖励误泛化,即奖励模型对与偏好无关的伪影特征过拟合;(2)在RL优化期间缺乏合适的正则化,因为现有的基于token的约束常常过度限制策略空间。为此,我们提出基于信息瓶颈(Information Bottleneck, IB)原理的信息论奖励建模框架(InfoRM),以过滤偏好无关的信息以缓解奖励误泛化。我们进一步观察到,奖励被入侵的响应在InfoRM的IB潜在空间中表现为显著的离群点,通过与SFT分布的马氏距离(Mahalanobis distance)进行衡量。基于此,我们引入IBL(Information Bottleneck Loss),这是一种分布层面的正则化,对此类偏离进行惩罚,有效扩大了优化景观,同时保持对齐。我们证明了IBL在IB潜在空间中等价于悲观RL目标。最后,我们提出马氏离群概率(Mahalanobis Outlier Probability, MOP),这是一种用于量化奖励入侵严重程度的统计指标,使我们能够原则性地进行超参数调优和在线缓解,如提前停止。广泛的实验在多样化的大语言模型和数据集上确认了我们发现的普遍性、InfoRM和IBL的有效性,以及MOP作为诊断工具的可靠性——共同推动了RLHF的前沿发展。

关键词

引用

@article{arxiv.2510.13694,
  title  = {Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking},
  author = {Yuchun Miao and Liang Ding and Sen Zhang and Rong Bao and Lefei Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2510.13694},
  year   = {2025}
}

备注

46 pages, 36 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence