用于大语言模型对齐的贝叶斯奖励模型
机器学习
2024-07-04 v2
摘要
为确保大语言模型(LLM)的响应有益且无毒,通常使用基于人类偏好数据训练的奖励模型。然后通过最佳n采样(best-of-, BoN)选择高奖励的LLM响应,或通过基于人类反馈的强化学习(RLHF)进一步优化LLM以产生高奖励的响应。然而,这些过程容易受到奖励过度优化或“欺骗”的影响,即由于奖励模型的缺陷而非真实偏好,响应获得高奖励,尤其是当提示或响应偏离训练数据时。为应对这些挑战,我们提出训练一个贝叶斯奖励模型,该模型在远离训练数据分布时发出更高的不确定性信号。我们使用拉普拉斯近似对LoRA权重训练了贝叶斯奖励模型,并发现由此产生的不确定性估计可以有效缓解BoN采样中的奖励过度优化。
引用
@article{arxiv.2402.13210,
title = {Bayesian Reward Models for LLM Alignment},
author = {Adam X. Yang and Maxime Robeyns and Thomas Coste and Zhengyan Shi and Jun Wang and Haitham Bou-Ammar and Laurence Aitchison},
journal= {arXiv preprint arXiv:2402.13210},
year = {2024}
}