中文

SoLA:利用软激活稀疏性和低秩分解进行大语言模型压缩

计算与语言 2026-04-07 v1 人工智能

摘要

大型语言模型(LLM)在 various 任务中展现出惊人的能力,但其十亿级参数给部署带来了挑战。虽然已有方法试图缩小LLM的规模,但需要特殊硬件支持或保持模型质量的高昂后训练成本。为促进高效且可负担的模型压缩,本文提出了一种新颖的训练-free 压缩方法,用于LLM,命名为"SoLA",该方法利用软激活稀疏性(Soft activation sparsity)和低秩分解(Low-rank decomposition)。SoLA 能够识别和保留对推理贡献显著的少数组件,同时通过低秩分解压缩大部分组件,基于我们对现代LLM前馈网络(feed-forward network, FFN)中激活模式的分析。为缓解分解损失,SoLA 配备了自适应的组件级低秩分配策略,为不同权重矩阵分配合适的截断位置。我们在LLaMA-2-7B/13B/70B和 Mistral-7B 模型上进行了广泛实验。SoLA 在语言建模和下游任务准确率方面表现出显著提升,且无需后训练。例如,在LLaMA-2-70B模型上采用30%压缩率时,SoLA 通过降低困惑度从6.95至4.44,提升下游任务准确率10%。

关键词

引用

@article{arxiv.2604.03258,
  title  = {SoLA: Leveraging Soft Activation Sparsity and Low-Rank Decomposition for Large Language Model Compression},
  author = {Xinhao Huang and You-Liang Huang and Zeyi Wen},
  journal= {arXiv preprint arXiv:2604.03258},
  year   = {2026}
}