MaxMin-RLHF:与多样化人类偏好对齐
计算与语言
2024-12-30 v2 人工智能
机器学习
机器人学
摘要
基于人类反馈的强化学习(RLHF)通过采用从偏好数据中导出的单一奖励模型,使语言模型与人类偏好对齐。然而,这种方法忽略了从多个用户收集的数据中固有的丰富的人类偏好多样性。在这项工作中,我们首先推导出单一奖励RLHF对齐的不可能性结果,从而凸显了其在表示多样化人类偏好方面的不足。为了为该问题提供一个公平的解决方案,我们通过期望最大化算法学习一个偏好分布的混合模型,并受社会选择理论中平等主义原则的启发,为策略学习提出了一个MaxMin对齐目标,以更好地代表多样化的人类偏好。我们阐明了所提出的方法与分布鲁棒优化和通用效用RL之间的联系,从而突显了我们所提解决方案的通用性和鲁棒性。我们在小规模(GPT-2)和大规模语言模型(使用Tulu2-7B)上展示了全面的实验结果,并证明了所提方法在存在多样化人类偏好情况下的有效性。我们的算法在胜率上相比传统RLHF算法平均提高了16%以上,并将少数群体的胜率(准确率)提高了33%以上,同时不损害多数群体的性能,展示了我们方法的鲁棒性和公平性。我们指出,本工作的发现不仅限于语言模型,也适用于一般的强化学习。
引用
@article{arxiv.2402.08925,
title = {MaxMin-RLHF: Alignment with Diverse Human Preferences},
author = {Souradip Chakraborty and Jiahao Qiu and Hui Yuan and Alec Koppel and Furong Huang and Dinesh Manocha and Amrit Singh Bedi and Mengdi Wang},
journal= {arXiv preprint arXiv:2402.08925},
year = {2024}
}