中文

学习你的参考模型以实现真正良好的对齐

机器学习 2025-02-26 v4 计算与语言

摘要

尽管大型语言模型(LLMs)的离线对齐方法不需要直接的奖励模型,但它们仍然容易受到过度优化的影响。当训练后的模型过度偏离参考策略时,就会出现这个问题,导致样本质量下降。我们提出了一种新的离线对齐方法范式,称为 Trust Region(包括变体 TR-DPO、TR-IPO、TR-KTO),它在整个训练过程中动态更新参考策略。我们的结果表明,Trust Region 对齐方法有效缓解了过度优化,使得模型即使在大幅偏离初始参考策略时也能保持强大的性能。我们不仅通过表现出过度优化减少的简单示例证明了这些方法的有效性,还通过在特定任务(如乐于助人且无害的对话以及摘要生成)中的直接并排比较证明了其有效性,在这些任务中它们超越了传统方法。此外,我们报告了在 AlpacaEval 2 和 Arena-Hard 基准测试上使用 Llama3 模型在通用助手设置中的显著改进,突出了 Trust Region 方法相对于经典方法的优势。

关键词

引用

@article{arxiv.2404.09656,
  title  = {Learn Your Reference Model for Real Good Alignment},
  author = {Alexey Gorbatovski and Boris Shaposhnikov and Alexey Malakhov and Nikita Surnachev and Yaroslav Aksenov and Ian Maksimov and Nikita Balagansky and Daniil Gavrilov},
  journal= {arXiv preprint arXiv:2404.09656},
  year   = {2025}
}