中文

SAIL:自改进高效在线对齐大型语言模型

机器学习 2024-06-25 v1 人工智能 计算与语言 机器学习

摘要

强化学习从人类反馈 (RLHF) 是对齐大型语言模型 (LLM) 与人类偏好关系的关键方法。然而,当前的离线对齐方法如 DPO、IPO 和 SLiC 过度依赖固定的偏好数据集,可能导致次优性能。另一方面,近期文献聚焦于设计在线 RLHF 方法,但仍缺乏统一的概念性表述,且存在分布迁移问题。为此,我们建立了在线 LLM 对齐基于双层优化的论证。通过将该表述化简为高效的单层一阶方法(利用奖励-策略等价性),本方法生成新样本并通过探索响应和调节偏好标签来迭代细化模型对齐。如此,使对齐方法能够以在线和自我改进的方式运行,并可将先前的在线 RLHF 方法作为特例推广。与最先进的迭代 RLHF 方法相比,我们的方法在最小计算开销下显著提高了在开源数据集上的对齐性能。

关键词

引用

@article{arxiv.2406.15567,
  title  = {SAIL: Self-Improving Efficient Online Alignment of Large Language Models},
  author = {Mucong Ding and Souradip Chakraborty and Vibhu Agrawal and Zora Che and Alec Koppel and Mengdi Wang and Amrit Bedi and Furong Huang},
  journal= {arXiv preprint arXiv:2406.15567},
  year   = {2024}
}

备注

24 pages, 6 figures, 3 tables