中文

RLAIF 与 RLHF:用 AI 反馈扩展基于人类反馈的强化学习

计算与语言 2024-09-04 v3 人工智能 机器学习

摘要

基于人类反馈的强化学习(RLHF)已被证明能有效将大语言模型(LLMs)与人类偏好对齐,但收集高质量偏好标签代价高昂。Bai 等人提出的 AI 反馈强化学习(RLAIF)提供了一种有前景的替代方案,其在现成 LLM 生成的偏好上训练奖励模型(RM)。在摘要、有用对话生成和无害对话生成任务中,我们展示 RLAIF 取得了与 RLHF 相当的性能。此外,我们迈向“自我改进”一步,证明即使 AI 标注器与策略大小相同、甚至是与初始策略完全相同的检查点,RLAIF 也能超越监督微调基线。最后,我们引入直接 RLAIF(d-RLAIF)——一种在 RL 期间直接从现成 LLM 获取奖励而绕过 RM 训练的技术,其取得了优于标准 RLAIF 的性能。我们的结果表明 RLAIF 可达到与使用人类反馈相当的性能,为 RLHF 的可扩展性限制提供了潜在解决方案。

关键词

引用

@article{arxiv.2309.00267,
  title  = {RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback},
  author = {Harrison Lee and Samrat Phatale and Hassan Mansoor and Thomas Mesnard and Johan Ferret and Kellie Lu and Colton Bishop and Ethan Hall and Victor Carbune and Abhinav Rastogi and Sushant Prakash},
  journal= {arXiv preprint arXiv:2309.00267},
  year   = {2024}
}

备注

Presented at ICML 2024