中文

量化侧调谐:量化大语言模型的快速且内存高效微调

机器学习 2024-01-17 v1 人工智能

摘要

微调大语言模型(LLMs)在各种下游任务中已被证明是有效的。现有的微调LLM的方法要么专注于参数高效微调(仅更新少量可训练参数),要么试图减少微调训练阶段的内存占用。通常,微调期间的内存占用来自三个方面:模型权重、优化器状态和中间激活。然而,现有工作仍需要大量内存,且没有一种方法能同时减少所有三个来源的内存占用。在本文中,我们提出了量化侧调谐(QST),它通过双阶段过程实现LLM的内存高效和快速微调。首先,QST将LLM的模型权重量化为4位,以减少LLM原始权重的内存占用;QST还引入了一个与LLM分离的侧网络,该网络利用LLM的隐藏状态进行特定任务的预测。使用独立的侧网络避免了通过LLM进行反向传播,从而减少了中间激活的内存需求。此外,QST利用多个低秩适配器和无梯度下采样模块显著减少可训练参数,从而节省优化器状态的内存占用。实验表明,与最先进方法相比,QST可以将总内存占用减少高达2.3倍,并将微调过程加速高达3倍,同时达到有竞争力的性能。在全微调情况下,QST可以将总内存占用减少高达7倍。

关键词

引用

@article{arxiv.2401.07159,
  title  = {Quantized Side Tuning: Fast and Memory-Efficient Tuning of Quantized Large Language Models},
  author = {Zhengxin Zhang and Dan Zhao and Xupeng Miao and Gabriele Oliaro and Qing Li and Yong Jiang and Zhihao Jia},
  journal= {arXiv preprint arXiv:2401.07159},
  year   = {2024}
}