变换与组合奖励以对齐大型语言模型
计算与语言
2024-07-22 v2 人工智能
摘要
将语言模型与人类偏好对齐的常见方法是首先从偏好数据中学习一个奖励模型,然后使用该奖励模型更新语言模型。我们研究了这种方法中出现的两个密切相关的问题。第一,奖励模型的任何单调变换都保持偏好排序;是否存在一个比其他选择“更好”的选择?第二,我们通常希望将语言模型与多个属性对齐:应该如何组合多个奖励模型?利用对齐过程的概率解释,我们为(常见情况下的)从Bradley-Terry偏好模型学习的奖励确定了一个自然的变换选择。推导出的变换很简单:我们对中心化奖励应用log-sigmoid函数,这种方法称为“LSC变换”(log-sigmoid中心化变换)。该变换有两个重要性质。首先,它强调改进表现较差的输出,而不是已经得分较高的输出。这既减轻了欠拟合(某些提示未得到改进),也减轻了奖励黑客(模型学会利用奖励模型的错误规范)。其次,它通过将求和与逻辑合取联系起来,实现了奖励的原则性聚合:变换后奖励的总和对应于输出在所有测量属性上“好”的概率,我们在某种意义上使其精确。使用RLHF将语言模型对齐为既有帮助又无害的实验表明,与基线(未变换)方法相比有显著改进。
引用
@article{arxiv.2402.00742,
title = {Transforming and Combining Rewards for Aligning Large Language Models},
author = {Zihao Wang and Chirag Nagpal and Jonathan Berant and Jacob Eisenstein and Alex D'Amour and Sanmi Koyejo and Victor Veitch},
journal= {arXiv preprint arXiv:2402.00742},
year = {2024}
}