大语言模型中 RLHF 的秘密(第二部分):奖励建模
人工智能
2024-01-15 v2
摘要
基于人类反馈的强化学习(RLHF)已成为将语言模型与人类价值观和意图对齐的关键技术,使模型能够生成更有用且更无害的回复。奖励模型被训练为人类偏好的代理,以驱动强化学习优化。尽管奖励模型常被视为实现高性能的核心,但在实际应用中面临以下挑战:(1) 数据集中错误和模糊的偏好对可能阻碍奖励模型准确捕捉人类意图。(2) 在特定分布数据上训练的奖励模型往往难以泛化到分布外的样本,且不适合迭代式 RLHF 训练。在本报告中,我们尝试解决这两个问题。(1) 从数据角度,我们提出了一种基于多个奖励模型投票机制的方法来衡量数据中的偏好强度。实验结果证实,具有不同偏好强度的数据对奖励模型性能有不同的影响。我们引入了一系列新颖的方法来减轻数据集中错误和模糊偏好的影响,并充分利用高质量的偏好数据。(2) 从算法角度,我们引入对比学习来增强奖励模型区分被选择和被拒绝回复的能力,从而提升模型泛化性。此外,我们采用元学习使奖励模型能够保持在分布外样本中辨别细微差异的能力,该方法可用于迭代式 RLHF 优化。
引用
@article{arxiv.2401.06080,
title = {Secrets of RLHF in Large Language Models Part II: Reward Modeling},
author = {Binghai Wang and Rui Zheng and Lu Chen and Yan Liu and Shihan Dou and Caishuang Huang and Wei Shen and Senjie Jin and Enyu Zhou and Chenyu Shi and Songyang Gao and Nuo Xu and Yuhao Zhou and Xiaoran Fan and Zhiheng Xi and Jun Zhao and Xiao Wang and Tao Ji and Hang Yan and Lixing Shen and Zhan Chen and Tao Gui and Qi Zhang and Xipeng Qiu and Xuanjing Huang and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2401.06080},
year = {2024}
}