中文

评估 AI 反馈用于大语言模型对齐的有效性

机器学习 2024-02-20 v1 人工智能 计算与语言

摘要

强化学习与 AI 反馈 (RLAIF) 是提高强大预训练语言模型指令跟随能力的流行范式。RLAIF 首先使用来自教师模型的演示进行监督微调 (SFT),然后使用来自批评模型的反馈进行进一步的强化学习 (RL) 微调。虽然最近的流行开源模型在 RL 步骤上显示出显著的性能提升,但本文我们质疑这一 RL 步骤的复杂性是否真正必要用于 AI 反馈。我们展示,RL 步骤的改进几乎完全归因于使用较弱的教师模型(例如 GPT-3.5)进行 SFT 数据收集,而用于 AI 反馈生成的批评模型(例如 GPT-4)较强。具体而言,我们表明使用 GPT-4 作为教师进行简单的监督微调即可超越现有的 RLAIF 流程。更一般地,我们发现 RLAIF 的收益在不同的基模型家族、测试时间评估协议和批评模型之间差异很大。最后,我们提供了当 SFT 可能优于完整的两步 RLAIF 流水线以及如何在实践中最大化地利用 RLAIF 的建议。

关键词

引用

@article{arxiv.2402.12366,
  title  = {A Critical Evaluation of AI Feedback for Aligning Large Language Models},
  author = {Archit Sharma and Sedrick Keh and Eric Mitchell and Chelsea Finn and Kushal Arora and Thomas Kollar},
  journal= {arXiv preprint arXiv:2402.12366},
  year   = {2024}
}