模型外推加速对齐
机器学习
2025-06-02 v5 人工智能
计算与语言
摘要
鉴于大语言模型(LLM)偏好对齐训练的高计算成本,探索降低训练开销的高效方法仍然是一个重要且引人注目的研究问题。受对齐训练通常仅涉及参数微小变化而不向模型注入新知识的观察启发,我们提出了一种名为 ExPO(模型外推)的简便方法,以加速 LLM 与人类偏好的对齐。给定一个部分训练的模型及其初始 SFT 检查点,ExPO 基于一阶近似简单放大参数变化,从而改进对齐训练的隐式优化目标,且无需任何额外的训练开销。通过对照实验,我们证明 ExPO 能将仅用 20% 步数训练的 DPO 模型提升至超越完全训练的模型。此外,我们表明 ExPO 显著提升了现有的开源 LLM(参数量从 1.8B 到 70B)在领先的 AlpacaEval 2.0 和 MT-Bench 基准上的表现,这凸显了 ExPO 在高效增强 LLM 对齐方面的更广泛实用性。
引用
@article{arxiv.2404.16792,
title = {Model Extrapolation Expedites Alignment},
author = {Chujie Zheng and Ziqi Wang and Heng Ji and Minlie Huang and Nanyun Peng},
journal= {arXiv preprint arXiv:2404.16792},
year = {2025}
}
备注
ACL 2025