中文

LLM的高效对齐方法

机器学习 2024-11-12 v2 人工智能 计算与语言

摘要

我们研究了在预算在线反馈条件下高效对齐大型语言模型(LLMs)的方法。我们首先在上下文博弈Bandit的框架下构建LLM对齐问题。该框架涵盖了最近的范式,如在线RLHF和在线DPO,本质上寻求结合在线主动探索的样本高效算法。借鉴Bandit理论的见解,我们引入了一种基于Thompson采样的统一算法,并展示了其在两种不同LLM对齐场景中的应用。高效实现该算法的实际智能体SEA(Sample-Efficient Alignment,样本高效对齐),通过三个模型规模(1B、2.8B、6.9B)和三种偏好学习算法(DPO、IPO、SLiC)的大量实验进行了实证验证。结果表明,SEA在对齐Oracle偏好方面实现了高度样本高效,优于最近的LLM主动探索方法。此外,我们发布了SEA的实现以及一个专为LLM在线对齐设计的高效代码库,旨在加速该领域的未来研究。

关键词

引用

@article{arxiv.2411.01493,
  title  = {Sample-Efficient Alignment for LLMs},
  author = {Zichen Liu and Changyu Chen and Chao Du and Wee Sun Lee and Min Lin},
  journal= {arXiv preprint arXiv:2411.01493},
  year   = {2024}
}