SLaB:用于高效大语言模型的稀疏-低秩-二元分解
机器学习
2026-04-07 v1 人工智能
摘要
大语言模型(LLM)的快速增长因其巨大的计算和内存需求而带来了显著的部署挑战。虽然模型压缩(如网络剪枝)提供了潜在的解决方案,但大多数现有方法在高压缩率下往往无法保持良好的性能。为此,我们提出了 SLaB,一个新颖的框架,将每个线性层权重分解为三个互补组件:稀疏矩阵、低秩矩阵和二元矩阵。SLaB 无需重新训练,并利用激活感知剪枝分数来指导分解过程。在 Llama 家族模型上的实验表明,SLaB 取得了最先进性能,在 50% 压缩率下相较于现有方法将困惑度降低高达 36%,并在零样本任务上相较于基线将准确率提高高达 8.98%。
引用
@article{arxiv.2604.04493,
title = {SLaB: Sparse-Lowrank-Binary Decomposition for Efficient Large Language Models},
author = {Ziwei Li and Yuang Ma and Yi Kang},
journal= {arXiv preprint arXiv:2604.04493},
year = {2026}
}