LIRE:用于偏好对齐的列表式奖励增强
计算与语言
2024-06-05 v2 机器学习
摘要
最近,为了减轻有毒或无益内容,将大型语言模型(LLM)的生成与人类价值观对齐取得了巨大进展。利用来自人类反馈的强化学习(RLHF)被证明是有效的,并被研究人员广泛采用。然而,实现RLHF是复杂的,其对超参数的敏感性使得实现稳定的性能和可扩展性具有挑战性。此外,当前的偏好对齐方法主要集中在成对比较上,对多响应场景的探索有限,从而忽视了候选池中潜在的丰富性。基于上述原因,我们提出了一种新方法:用于偏好对齐的列表式奖励增强(LIRE),这是一种基于梯度的奖励优化方法,将多个响应的离线奖励整合到一个简化的列表式框架中,从而消除了训练期间在线采样的需要。LIRE实现简单,需要最少的参数调整,并且与成对范式无缝对齐,同时自然地扩展到多响应场景。此外,我们引入了一种自增强算法,旨在训练过程中迭代优化奖励。我们的实验表明,LIRE在对话和摘要任务的多个基准上始终优于现有方法,并且在使用代理奖励模型和人工评估时,对分布外数据具有良好的可迁移性。
引用
@article{arxiv.2405.13516,
title = {LIRE: listwise reward enhancement for preference alignment},
author = {Mingye Zhu and Yi Liu and Lei Zhang and Junbo Guo and Zhendong Mao},
journal= {arXiv preprint arXiv:2405.13516},
year = {2024}
}
备注
Accepted by ACL 2024 Findings