中文

BOND:基于最佳-N蒸馏对齐大语言模型

机器学习 2024-07-23 v1 人工智能 计算与语言

摘要

强化学习从人类反馈 (RLHF) 是驱动最新大型语言模型质量和安全性的关键因素。然而,一种意想不到的简单且强大的推理时策略是从 N 个候选答案中选择最佳答案的 Best-of-N 采样。在本文中,我们提出一种新的 RLHF 算法 Best-of-N 蒸馏 (BOND),旨在在推理时不产生其显著计算开销的情况下模拟 Best-of-N。具体而言,BOND 是一种分布匹配算法,迫使策略生成的分布趋近于 Best-of-N 分布。我们使用杰弗里斯散度 (正向和反向 KL 线的线性组合) 在模式覆盖和模式寻求之间进行平衡,并推导一种利用移动锚点的迭代公式以提高效率。我们通过在 abstractive 摘要任务和 Gemma 模型上的实验展示了该方法的有效性以及Several设计选择。通过 BOND 对齐的 Gemma 策略在多个基准测试中超过其他 RLHF 算法。

关键词

引用

@article{arxiv.2407.14622,
  title  = {BOND: Aligning LLMs with Best-of-N Distillation},
  author = {Pier Giuseppe Sessa and Robert Dadashi and Léonard Hussenot and Johan Ferret and Nino Vieillard and Alexandre Ramé and Bobak Shariari and Sarah Perrin and Abe Friesen and Geoffrey Cideron and Sertan Girgin and Piotr Stanczyk and Andrea Michi and Danila Sinopalnikov and Sabela Ramos and Amélie Héliou and Aliaksei Severyn and Matt Hoffman and Nikola Momchev and Olivier Bachem},
  journal= {arXiv preprint arXiv:2407.14622},
  year   = {2024}
}