将稀疏微调扩展至大型语言模型
计算与语言
2024-02-05 v2 人工智能
机器学习
摘要
由于参数量巨大,大型语言模型(LLMs)难以进行全量微调(例如使用指令或人类反馈)。一类参数高效的稀疏微调方法在性能方面显示出希望,但其内存需求随 LLM 规模的增大而成比例增加。在这项工作中,我们将稀疏微调扩展至 LLaMA 2 7B 和 13B 等最先进的 LLM。我们提出了 SpIEL,一种新颖的稀疏微调方法,该方法对于所需的密度级别,维护一个参数索引数组及其相对于预训练值的增量(deltas)。该方法迭代执行以下步骤:(a) 更新活跃增量,(b) 剪枝索引(基于其增量幅度的变化),以及 (c) 索引再生。对于再生,我们探索了两种标准:基于少数候选参数的累积梯度,或使用高效的 SM3 优化器估计的近似动量。我们在标准数据集混合体上对 LLM 进行指令微调实验,发现 SpIEL 在性能上通常优于 LoRA(低秩自适应)等流行的参数高效微调方法,且在运行时间上相当。此外,我们展示了 SpIEL 与量化和高效优化器的兼容性,以促进向更大模型规模的扩展。我们在 https://github.com/AlanAnsell/peft 发布 SpIEL 代码,并在 https://github.com/ducdauge/sft-llm 发布指令微调实验代码。
引用
@article{arxiv.2401.16405,
title = {Scaling Sparse Fine-Tuning to Large Language Models},
author = {Alan Ansell and Ivan Vulić and Hannah Sterz and Anna Korhonen and Edoardo M. Ponti},
journal= {arXiv preprint arXiv:2401.16405},
year = {2024}
}