LLM-BIP:基于块级前向重要性传播的大语言模型结构化剪枝
计算与语言
2024-12-10 v1 人工智能
摘要
大语言模型 (LLM) 在 various language tasks 上展现出卓越的性能,但其庞大的规模和高计算成本阻碍了其广泛部署。结构化剪枝是一种常用技术,通过移除冗余连接(如通道和注意力头)来引入稀疏性,从而在推理期间实现直接硬件加速。现有的结构化剪枝方法通常采用全局或层级剪枝准则,但因对连接重要性评估不准确而受限。全局剪枝方法通常依赖接近零且不可靠的梯度来评估组件重要性,而层级剪枝方法则面临显著的剪枝误差累积问题。为此,我们提出一种更精确的剪枝度量方法,基于块级重要性得分传播,称为 LLM-BIP。具体而言,LLM-BIP 通过评估其对相应 transformer 块输出的影响来精确评估连接重要性,这可以通过从上界(基于 Lipschitz 连续性假设)在单次前向传播中高效近似。我们使用 LLaMA-7B、Vicuna-7B 和 LLaMA-13B 对所提方法进行评估,测试于常见零样任务。结果表明,我们的方法在常用推理任务上相比以前的最佳基线平均提升 3.26%。在 WikiText2 数据集和 PTB 数据集上,分别平均降低了 14.09 和 68.76 的 perplexity。
引用
@article{arxiv.2412.06419,
title = {LLM-BIP: Structured Pruning for Large Language Models with Block-Wise Forward Importance Propagation},
author = {Haihang Wu},
journal= {arXiv preprint arXiv:2412.06419},
year = {2024}
}