中文

Q-GaLore:基于INT4投影和层自适应低秩梯度的量化GaLore

机器学习 2024-07-12 v1

摘要

训练大型语言模型(LLM)由于参数数量和相关优化状态的大,导致内存消耗大。GaLore是一种最近的方法,通过将权重梯度投影到低秩子空间来减少内存使用,而不损害性能。然而,GaLore依赖于耗时的奇异值分解(SVD)操作来识别子空间,并且频繁的子空间更新导致显著的训练时间开销。此外,GaLore在更易访问的微调场景中,仅在准确性和效率方面略有于LoRA。为了解决这些限制,我们引入Q-GaLore,这是一种新方法,通过结合量化和低秩投影大幅减少内存使用,超越了GaLore的优势。我们的方法基于两个关键观察:(i)梯度子空间具有多样性属性,其中一些层在训练初期会快速收敛,而其他层则频繁变化;(ii)投影矩阵对低位量化高度鲁棒。利用这些见解,Q-GaLore根据其收敛统计信息自适应地更新梯度子空间,在显著减少SVD操作次数的同时实现可望而不可及的性能。我们将投影矩阵保持为INT4格式,权重为INT8格式,包含随机舍入来捕获累积的梯度信息。这一方法使我们仅使用低精度权重即可实现高精度训练轨迹。我们展示了Q-GaLore在内存效率方面实现了高度具竞争力的性能。在预训练时,Q-GaLore使我们能够在仅16 GB内存的单个NVIDIA RTX 4060 Ti上从头训练LLaMA-7B模型。在微调时,它比LoRA和GaLore减少最高50%的内存消耗,同时在相同内存成本下持续超过QLoRA。

关键词

引用

@article{arxiv.2407.08296,
  title  = {Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank Gradients},
  author = {Zhenyu Zhang and Ajay Jaiswal and Lu Yin and Shiwei Liu and Jiawei Zhao and Yuandong Tian and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2407.08296},
  year   = {2024}
}