中文

3BASiL:稀疏低秩压缩大语言模型的算法框架

机器学习 2026-03-03 v1 机器学习

摘要

稀疏低秩(S+LR)(\mathbf{S} + \mathbf{LR})分解是大语言模型压缩的热门方向,旨在将预训练模型权重分解为稀疏矩阵与低秩矩阵之和(WS+LR)(\mathbf{W} \approx \mathbf{S} + \mathbf{LR})。尽管已有进展,现有方法常导致性能显著下降。本文引入3BASiL-TM,一种高效单次后训练方法,解决上述问题。我们首先提出新颖的三块交替方向乘子方法(3BASiL),以保证收敛,最小化层级重构误差。随后设计高效变换匹配(TM)细化步骤,在变换层级联合优化稀疏与低秩组件。该步骤最小化新型内存高效损失,实现跨层级输出对齐。值得注意的是,TM程序具有普适性,可提升任何(S+LR)(\mathbf{S} + \mathbf{LR})分解,包括纯稀疏方案。数值实验表明,3BASiL-TM在(2:4稀疏+64 LR)配置下,将WikiText2困惑度与密集LLaMA-8B模型的差距缩小30%以上。此外,本方法在A100 GPU上比现有SOTA方法快2.5倍。代码已公开于https://github.com/mazumder-lab/3BASiL。

关键词

引用

@article{arxiv.2603.01376,
  title  = {3BASiL: An Algorithmic Framework for Sparse plus Low-Rank Compression of LLMs},
  author = {Mehdi Makni and Xiang Meng and Rahul Mazumder},
  journal= {arXiv preprint arXiv:2603.01376},
  year   = {2026}
}

备注

The Thirty-ninth Annual Conference on Neural Information Processing Systems