中文

稀疏性诱导:大型语言模型准确后训练剪枝的稀疏化方法

计算与语言 2026-02-26 v1 人工智能

摘要

大型语言模型在文本生成方面展现出强大能力,但其不断增大的参数规模带来了计算和内存效率的挑战。后训练稀疏化 (PTS) 通过从稠密网络中移除权重来降低模型成本,是一种有效方法。然而,原生稠密矩阵缺乏高稀疏性,现有方法直接移除权重会破坏模型状态,导致即使进行后调谐也难以实现令人满意的性能恢复。我们提出了稀疏性诱导方法,通过在分布层面和特征层面促进模型向更高稀疏度的发展,以突破 PTS 的极限。 在分布层面,我们通过数学等价的缩放转换来增强分布稀疏性,这些转换完全可吸收且不增加额外参数或推理时开销。在特征层面,我们引入谱范数损失从低秩角度促进特征稀疏性。跨越多样化模型架构和任务的实验表明,我们的方法进一步增强了稀疏性友好性,实现了超越现有方法的优异剪枝性能。

关键词

引用

@article{arxiv.2602.21652,
  title  = {Sparsity Induction for Accurate Post-Training Pruning of Large Language Models},
  author = {Minhao Jiang and Zhikai Li and Xuewen Liu and Jing Zhang and Mengjuan Chen and Qingyi Gu},
  journal= {arXiv preprint arXiv:2602.21652},
  year   = {2026}
}

备注

5 pages, 1 figure, 4 tables