中文

探索低秩适配对RLHF性能、效率与正则化的影响

计算与语言 2023-09-19 v1

摘要

在RLHF的最后一个阶段,大语言模型通过PPO训练与人类意图对齐,这一过程通常需要大规模计算资源。在本技术报告中,我们实证研究了使用低秩适配(LoRA)的高效RLHF实现,该实现仅用两块A100 GPU即可在Alpaca数据集上对齐LLaMA 7B检查点,而全模型微调需要八块。尽管仅调优了LLaMA 7B 0.2%的参数,我们的实现取得了比公开发布的采用全模型微调的AlpacaFarm检查点更好的性能。接下来,我们分析了基于LoRA的PPO实现的若干配置,改变了训练目标中KL正则化项的形式。我们发现:(1)在我们的LoRA设置下,移除该惩罚项不会损害在AlpacaFarm评测集上的性能;(2)其他正则化器,如Jensen-Shannon散度,带来了性能提升;(3)虽然PPO训练对模型生成回复的事实性有负面影响,使用LoRA训练在很大程度上缓解了此效应。我们发布代码与预训练检查点以促进未来关于更高效RLHF的研究。

关键词

引用

@article{arxiv.2309.09055,
  title  = {Exploring the impact of low-rank adaptation on the performance, efficiency, and regularization of RLHF},
  author = {Simeng Sun and Dhawal Gupta and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2309.09055},
  year   = {2023}
}