中文

从低秩梯度子空间稳定到低秩权重:观察、理论与应用

机器学习 2025-06-10 v2

摘要

大型语言模型 (LLM) 的权重矩阵常可表示为低秩形式,从而有望缓解内存和计算资源需求。不同于侧重开发新矩阵分解的先前工作,本文通过分析梯度子空间的稳定性,研究 LLM 中权重矩阵的非均匀低秩特性。首先,我们提供了一个理论框架,通过 Hessian 分析来理解梯度子空间的稳定化。其次,我们实证性地建立了梯度动力学与权重矩阵低秩可表达性之间的重要关系。我们的发现表明,不同的 LLM 组件展现出不同的收敛低秩结构水平, necessitating 在各组件间进行可变秩压缩以最小化因压缩导致的性能下降。基于此结果,我们提出了 Weight Low-Rank Projection (WeLore),将权重压缩和内存高效微调统一为一个数据无关且一次性完成的方案。在压缩技术中,WeLore 将权重矩阵划分为低秩组件 (LRCs) 和非低秩组件 (N-LRCs),并对其进行合适编码以实现最小的性能损失。我们的梯度动力学视角表明,LRCs 在微调方面具有更好的能力,其独立微调可在显著降低内存和计算占用的情况下,紧密模拟甚至时常超越完整微调的训练损失轨迹和性能。代码已发布于 https://github.com/VITA-Group/WeLore。

关键词

引用

@article{arxiv.2407.11239,
  title  = {From Low Rank Gradient Subspace Stabilization to Low-Rank Weights: Observations, Theories, and Applications},
  author = {Ajay Jaiswal and Yifan Wang and Lu Yin and Shiwei Liu and Runjin Chen and Jiawei Zhao and Ananth Grama and Yuandong Tian and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2407.11239},
  year   = {2025}
}

备注

Accepted in ICML 2025