面向增强奖励与缓解对齐税的在线合并优化器
计算与语言
2024-05-29 v1 机器学习
摘要
在强化学习从人类反馈(RLHF)中有效对齐大语言模型(LLM),同时防止通过预训练和监督微调(SFT)所获取能力的退化,是一个核心挑战。本文首先发现,通过插值化RLHF和SFT模型参数可以调整人类偏好与基本能力之间的权衡,从而以牺牲对齐奖励为代价来降低对齐税。灵感来自于此,我们提出在RLHF的每个优化步骤中集成RL策略和SFT模型,以持续调节训练方向,引入在线合并优化器。具体而言,我们将SFT与预训练模型之间的参数差异的梯度与梯度进行合并,有效地将梯度引导至最大化奖励的SFT优化方向。我们展示了该优化器在不同的LLM家族(如Qwen和LLaMA)中表现良好,包括各种模型规模(从1.8B到8B)、各种RLHF算法(如DPO和KTO),以及现有的模型合并方法。它显著增强了对齐奖励,同时缓解了对齐税,实现了在14个基准测试中的更高整体性能。
引用
@article{arxiv.2405.17931,
title = {Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment},
author = {Keming Lu and Bowen Yu and Fei Huang and Yang Fan and Runji Lin and Chang Zhou},
journal= {arXiv preprint arXiv:2405.17931},
year = {2024}
}