中文

RLCD:基于对比蒸馏的强化学习用于语言模型对齐

计算与语言 2024-03-19 v3 人工智能

摘要

我们提出基于对比蒸馏的强化学习 (RLCD),一种无需使用人类反馈即可将语言模型对齐以遵循自然语言表述的原则(例如,变得更无害)的方法。RLCD 从两个对比的模型输出创建偏好对,一个使用旨在鼓励遵循给定原则的正向提示,另一个使用旨在鼓励违背原则的负向提示。使用两种不同的提示使得模型输出平均而言更具区分度,从而在缺乏人类标注的情况下产生更干净的偏好标签。我们随后使用这些偏好对训练一个偏好模型,该模型进而通过强化学习来改进基础未对齐语言模型。实证上,RLCD 在三个不同的对齐任务——无害性、有用性和故事大纲生成——以及在使用 7B 和 30B 模型规模模拟偏好数据时,均优于 RLAIF (Bai et al., 2022b) 和上下文蒸馏 (Huang et al., 2022) 基线。

关键词

引用

@article{arxiv.2307.12950,
  title  = {RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment},
  author = {Kevin Yang and Dan Klein and Asli Celikyilmaz and Nanyun Peng and Yuandong Tian},
  journal= {arXiv preprint arXiv:2307.12950},
  year   = {2024}
}

备注

ICLR 2024