面向即插即用混合稀疏性的 LLM 极度剪枝
计算与语言
2025-03-17 v1
摘要
N:M 结构化剪枝对于大型语言模型(LLM)至关重要,因为它可以移除不重要的网络权重并降低内存和计算需求。现有的剪枝方法主要侧重于设计度量指标来衡量网络组件的重要性以指导剪枝。除了这些指标的影响外,我们观察到不同层对网络性能具有不同的敏感性。因此,我们提出了一种基于 Fisher 信息矩阵(FIM)迹的高效方法,以定量测量并验证不同层之间的敏感性差异。基于此,我们提出了混合稀疏剪枝(MSP),该方法使用面向剪枝的进化算法(EA)来确定不同层的最佳稀疏度。为了保证快速收敛并获得出色的性能,我们利用受 FIM 启发的逐层敏感性来初始化 EA 的种群。此外,我们的 MSP 可以作为即插即用模块,随时可集成到现有剪枝方法中。在 LLaMA 和 LLaMA-2 上的语言建模和零样本任务中的大量实验证明了我们优越的性能。特别是,在极度剪枝率(例如 75%)下,我们的方法在困惑度(PPL)方面比现有方法高出数个数量级(图 1)。
引用
@article{arxiv.2503.11164,
title = {Towards Extreme Pruning of LLMs with Plug-and-Play Mixed Sparsity},
author = {Chi Xu and Gefei Zhang and Yantong Zhu and Luca Benini and Guosheng Hu and Yawei Li and Zhihong Zhang},
journal= {arXiv preprint arXiv:2503.11164},
year = {2025}
}