中文

对比式策略梯度:在监督友好方式下对齐 LLM 的序列级得分

机器学习 2025-01-17 v2

摘要

强化学习 (RL) 已用于使用从偏好数据训练的奖励模型来微调大语言模型 (LLM),以更好地与人类判断一致。最近引入的直接对齐方法通常更简单、更稳定、计算更轻松,能够更直接地实现这一目标。然而,这些方法无法优化任意奖励函数,偏好式方法也并非 LLM 唯一感兴趣的奖励(例如代码生成的单元测试或摘要任务中的文本蕴涵等)。RL 微调通常使用策略梯度的变体,需要基于或接近基于的样本,要求代价高昂的生成。我们引入对比式策略梯度 (Contrastive Policy Gradient, CoPG),这是一种简单且在数学上具有原则性的新的 RL 算法,能够即使从离策略数据中估计最优策略。它可以视为一种不依赖重要性抽样技术的离策略策略梯度方法,强调使用(正确的)状态基线的重要性。我们展示该方法可推广为直接对齐方法 IPO(身份偏好优化)以及经典策略梯度。我们在玩法问题上实验以说明其属性,同时也用于在摘要任务上微调 LLM,使用所学习的奖励函数作为实验目的下的真实奖励。

关键词

引用

@article{arxiv.2406.19185,
  title  = {Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion},
  author = {Yannis Flet-Berliac and Nathan Grinsztajn and Florian Strub and Bill Wu and Eugene Choi and Chris Cremer and Arash Ahmadian and Yash Chandak and Mohammad Gheshlaghi Azar and Olivier Pietquin and Matthieu Geist},
  journal= {arXiv preprint arXiv:2406.19185},
  year   = {2025}
}

备注

EMNLP 2024