面向大语言模型对齐的离线正则化强化学习
机器学习
2024-05-30 v1 人工智能
摘要
大语言模型对齐的主流框架,无论是通过人类反馈的强化学习还是直接偏好优化,都是从偏好数据中学习。这涉及构建数据集,其中每个元素是一个四元组,包含一个提示、两个独立响应(提示的完成)以及两个独立响应之间的人类偏好,从而产生一个偏好响应和一个非偏好响应。此类数据通常稀缺且收集成本高昂。另一方面,每个元素是由提示、响应和人类反馈组成的三元组的单轨迹数据集自然更为丰富。此类数据集的典型元素例如是LLM对用户提示的响应,后跟用户反馈(如点赞/点踩)。因此,在这项工作中,我们提出了DRO,即直接奖励优化,作为一个不需要成对偏好的框架及相关算法。DRO使用一个简单的均方目标,可以通过多种方式实现。我们使用T5编码器-解码器语言模型在经验上验证了我们的发现,并展示了DRO相对于选定基线(如Kahneman-Tversky优化)的性能。因此,我们确认DRO是一种简单且经验上令人信服的单轨迹策略优化方法。
引用
@article{arxiv.2405.19107,
title = {Offline Regularised Reinforcement Learning for Large Language Models Alignment},
author = {Pierre Harvey Richemond and Yunhao Tang and Daniel Guo and Daniele Calandriello and Mohammad Gheshlaghi Azar and Rafael Rafailov and Bernardo Avila Pires and Eugene Tarassov and Lucas Spangher and Will Ellsworth and Aliaksei Severyn and Jonathan Mallinson and Lior Shani and Gil Shamir and Rishabh Joshi and Tianqi Liu and Remi Munos and Bilal Piot},
journal= {arXiv preprint arXiv:2405.19107},
year = {2024}
}