基于在线 AI 反馈的直接语言模型对齐
人工智能
2024-03-04 v2 计算与语言
人机交互
摘要
直接偏好对齐 (DAP) 方法(如 DPO)最近已成为强化学习人类反馈 (RLHF) 的高效替代方案,无需单独的奖励模型。然而,DAP 方法中使用的偏好数据集通常在训练前收集且从不更新,因此反馈完全是离线的。此外,这些数据集中的响应通常采样自不同于正在对齐的语言模型的另一个模型,且由于模型在训练过程中不断演化,对齐阶段不可避免地是离策略的。在本研究中,我们主张在线反馈是关键并能改进 DAP 方法。我们的方法,即在线 AI 反馈 (OAIF),使用大语言模型 (LLM) 作为标注器:在每次训练迭代中,我们从当前模型采样两个响应,并提示 LLM 标注器选择更优的一个,从而提供在线反馈。尽管方法简单,我们通过多项任务中的人工评估证明,OAIF 优于离线 DAP 和 RLHF 方法。我们进一步表明,通过对 LLM 标注器的指令提示,OAIF 中利用的反馈易于控制。
引用
@article{arxiv.2402.04792,
title = {Direct Language Model Alignment from Online AI Feedback},
author = {Shangmin Guo and Biao Zhang and Tianlin Liu and Tianqi Liu and Misha Khalman and Felipe Llinares and Alexandre Rame and Thomas Mesnard and Yao Zhao and Bilal Piot and Johan Ferret and Mathieu Blondel},
journal= {arXiv preprint arXiv:2402.04792},
year = {2024}
}
备注
18 pages, 9 figures, 4 tables