通过贝叶斯非负奖励建模缓解 RLHF 中的奖励黑客问题
机器学习
2026-02-12 v1 人工智能
摘要
从人类偏好中学习的奖励模型是通过强化学习从人类反馈(RLHF)对大语言模型(LLM)进行对齐的核心,但它们常常因噪声注释和如响应长度或风格等系统性偏差而容易受到奖励黑客攻击。我们提出了贝叶斯非负奖励模型(Bayesian Non-Negative Reward Model, BNRM),这是一种原则化的奖励建模框架,将非负因子分析集成到Bradley-Terry(BT)偏好模型中。BNRM 通过稀疏、非负的潜在因子生成过程表示奖励,该生成过程在两个互补的层面上运行:实例特定的潜在变量导致解耦的奖励表示,而稀疏性作用于全局潜在因子,作为隐式去偏置机制,以抑制伪相关。除了这种解耦-去偏置结构外,BNRM 还实现了稳健的不确定性感知奖励学习。为了将 BNRM 扩展到现代 LLM,我们开发了一个基于深度模型表示的 amortized变分推断网络,实现高效的端到端训练。大量实验结果表明,BNRM 在缓解奖励过度优化、在分布迁移情况下的鲁棒性以及奖励分解的可解释性方面均显著优于强基线。
引用
@article{arxiv.2602.10623,
title = {Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling},
author = {Zhibin Duan and Guowei Rong and Zhuo Li and Bo Chen and Mingyuan Zhou and Dandan Guo},
journal= {arXiv preprint arXiv:2602.10623},
year = {2026}
}