中文

轴转因子分解:面向大语言模型高效推理的稀疏性紧凑元低秩表示

机器学习 2025-08-14 v3

摘要

大语言模型的快速发展推动了对有效模型压缩技术的需求,以降低内存和计算成本。低秩剪枝因其在所有密度下均兼容 GPU 而受到关注。然而,低秩剪枝难以匹配半结构化剪枝的性能,在相似密度下困惑度通常会翻倍。在本文中,我们提出了轴转因子分解(PIFA),这是一种无损的元低秩表示,能够以无监督方式学习任意低秩表示的紧凑形式,有效消除冗余信息。PIFA 识别主元行(线性无关的行)并将非主元行表示为线性组合,在秩等于维度 50% 时,实现了额外 24.2% 的内存节省和 24.6% 的推理速度提升。为缓解低秩剪枝造成的性能下降,我们引入了一种新颖的免重训练重构方法,以最小化误差累积(M)。MPIFA 将 M 和 PIFA 结合成端到端框架,显著优于现有的低秩剪枝方法,并取得了与半结构化剪枝相当的性能,同时在 GPU 效率和兼容性上超越了它。我们的代码可在 https://github.com/biomedical-cybernetics/pivoting-factorization 获取。

关键词

引用

@article{arxiv.2501.19090,
  title  = {Pivoting Factorization: A Compact Meta Low-Rank Representation of Sparsity for Efficient Inference in Large Language Models},
  author = {Jialin Zhao and Yingtao Zhang and Carlo Vittorio Cannistraci},
  journal= {arXiv preprint arXiv:2501.19090},
  year   = {2025}
}

备注

ICML 2025