中文

缓解RLHF的对齐税

机器学习 2024-10-15 v4

摘要

LLM在预训练期间获得了广泛的能力,但在人类反馈强化学习(RLHF)下对齐LLM可能导致遗忘预训练能力,这也被称为对齐税。为研究对齐税,我们使用OpenLLaMA-3B通过现有RLHF算法进行了实验,揭示了NLP任务中显著的对齐税。尽管存在多种缓解遗忘的技术,它们却常与RLHF性能相冲突,导致对齐性能与遗忘缓解之间的权衡,即对齐-遗忘权衡。本文中,我们展示了模型平均(简单地在RLHF前后模型权重间进行插值)令人惊讶地在众多竞争方法中实现了最强的对齐-遗忘帕累托前沿。为理解其有效性,我们对模型平均提供了理论洞见,揭示其通过在任务共享重叠特征空间的层上增加特征多样性来提升性能帕累托前沿。实证证据通过展示平均低层transformer层的益处 corroborates 了我们的分析。基于该分析以及平均transformer不同层会导致显著不同的对齐-遗忘权衡这一观察,我们提出异质模型平均(HMA)以异质地寻找各模型层的不同组合比例。HMA旨在最大化对齐性能同时产生最小的对齐税。此外,我们在OpenLLaMA-3B上的一系列RLHF算法中验证了HMA的性能,并进一步将发现扩展至由开源偏好模型和GPT4评估的Mistral-7B。代码见:https://github.com/avalonstrel/Mitigating-the-Alignment-Tax-of-RLHF.git。

关键词

引用

@article{arxiv.2309.06256,
  title  = {Mitigating the Alignment Tax of RLHF},
  author = {Yong Lin and Hangyu Lin and Wei Xiong and Shizhe Diao and Jianmeng Liu and Jipeng Zhang and Rui Pan and Haoxiang Wang and Wenbin Hu and Hanning Zhang and Hanze Dong and Renjie Pi and Han Zhao and Nan Jiang and Heng Ji and Yuan Yao and Tong Zhang},
  journal= {arXiv preprint arXiv:2309.06256},
  year   = {2024}
}

备注

EMNLP 2024 Main