Leftover Lunch:基于优势函数的语言模型离线强化学习
计算与语言
2024-04-23 v5
摘要
基于人类反馈的强化学习(RLHF)是语言模型(LM)对齐最突出的方法。然而,RLHF 是一个不稳定且数据饥渴的过程,持续需要新的高质量 LM 生成数据用于微调。我们引入优势函数 Leftover Lunch 强化学习(A-LoL),一类新的离线策略梯度算法,可在任意预存在数据上实现 RL 训练。通过将整个 LM 输出序列视为单一动作,A-LoL 允许将序列级分类器或人工设计的评分函数作为奖励。随后,利用 LM 的价值估计,A-LoL 仅在正优势(leftover)数据点上进行训练,使其对噪声具有鲁棒性。总体而言,A-LoL 是一种易于实现、样本高效且稳定的 LM 训练方案。我们通过四个不同的语言生成任务展示了 A-LoL 及其变体的有效性。我们与在线 RL(PPO)以及近期基于偏好(DPO、PRO)和基于奖励(GOLD)的离线 RL 基线进行比较。在常用 RLHF 基准 Helpful and Harmless Assistant(HHA)上,使用 A-LoL 方法训练的 LM 实现了最高多样性,且据人类评价比基线更安全、更有帮助。此外,在其余三个任务中,即使使用含噪声或次优的训练数据,A-LoL 也能优化多个不同的奖励函数。我们也发布了实验代码。https://github.com/abaheti95/LoL-RL
引用
@article{arxiv.2305.14718,
title = {Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models},
author = {Ashutosh Baheti and Ximing Lu and Faeze Brahman and Ronan Le Bras and Maarten Sap and Mark Riedl},
journal= {arXiv preprint arXiv:2305.14718},
year = {2024}
}
备注
published at ICLR 2024