论语言模型对齐中奖励模型的鲁棒性
计算与语言
2025-05-13 v1 人工智能
机器学习
摘要
Bradley-Terry (BT) 模型广泛应用于基于人类反馈的强化学习 (RLHF) 中的奖励建模。尽管其有效,但使用 BT 模型损失训练的奖励模型 (RM) 容易出现过优化,从而丧失对未见输入分布的泛化能力。在本文中,我们研究了 RM 训练中过优化的原因及其对 RLHF 过程的下游影响,强调了 RM 在未见数据上的分布鲁棒性的重要性。首先,我们表明隐藏状态范数的过度分散是过优化的主要来源。然后,我们提出了批次零和正则化 (BSR),以强制每批次的奖励总和以零为中心,从而约束具有极端幅值的奖励。我们通过四种过优化场景评估了 BSR 对提高 RM 鲁棒性的影响,其中 BSR 始终表现出更好的鲁棒性。随后,我们在 RLHF 训练中比较了普通 BT 模型和 BSR,并实证表明鲁棒的 RM 能更好地将策略与黄金偏好模型对齐。最后,我们将 BSR 应用于高质量数据和模型,在复杂的偏好预测任务中,其性能在 8B 规模上超越了最先进的 RM,提升超过 5%。通过使用 8B RM 进行 RLOO 训练,AlpacaEval 2.0 在将生成长度减少 40% 的同时,胜率提高了 7%,进一步突显了 RM 的鲁棒性会诱导 RLHF 训练的鲁棒性。我们发布了代码、数据和模型:https://github.com/LinkedIn-XFACT/RM-Robustness。
引用
@article{arxiv.2505.07271,
title = {On the Robustness of Reward Models for Language Model Alignment},
author = {Jiwoo Hong and Noah Lee and Eunki Kim and Guijin Son and Woojin Chung and Aman Gupta and Shao Tang and James Thorne},
journal= {arXiv preprint arXiv:2505.07271},
year = {2025}
}
备注
ICML 2025