面向大型语言模型微调的稀疏梯度压缩
机器学习
2025-02-04 v1
摘要
由于大型语言模型(LLMs)的广泛使用和开源模型的日益普及,针对下游任务微调LLMs已变得至关重要。然而,与微调相关的高内存成本仍然是一个重大挑战,尤其是随着模型规模的增大。为了解决这个问题,参数高效微调(PEFT)方法被提出,以最小化微调LLMs所需的参数数量。然而,这些方法通常将优化器状态的数量与模型参数的维度绑定,限制了微调过程中的灵活性和控制力。在本文中,我们提出了稀疏梯度压缩(SGC),这是一种旨在解决这些局限性的训练方案。我们的方法利用梯度中固有的稀疏性,通过将优化器状态投影到一个低维子空间来压缩它们,该子空间的维度独立于原始模型的参数。通过允许在任意低维子空间中进行优化器状态更新,SGC在内存效率和性能之间提供了灵活的权衡。我们通过实验证明,SGC能够比现有的PEFT方法更有效地减少优化器状态的内存使用。此外,通过在多个下游任务上微调LLMs,我们表明SGC可以在大幅降低优化器状态内存需求的同时提供卓越的性能,尤其是在数据有限和内存有限的环境中。
引用
@article{arxiv.2502.00311,
title = {Sparse Gradient Compression for Fine-Tuning Large Language Models},
author = {David H. Yang and Mohammad Mohammadi Amiri and Tejaswini Pedapati and Subhajit Chaudhury and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2502.00311},
year = {2025}
}