BlockPruner:面向大型语言模型的细粒度剪枝
计算与语言
2025-05-23 v4
摘要
随着大型语言模型(LLMs)规模和复杂性的快速增长,其训练和推理相关的成本显著增加。研究表明,LLMs中的某些层存在大量冗余,剪除这些层对整体性能影响很小。尽管基于这一见解已经开发了各种层剪枝方法,但它们普遍忽略了层内部更细粒度的冗余。在本文中,我们更深入地研究了LLMs的架构,并证明通过针对多头注意力(MHA)和多层感知器(MLP)块中的冗余可以实现更细粒度的剪枝。我们提出了一种新颖的、无需训练的、结构化剪枝方法,称为BlockPruner。与现有的层剪枝方法不同,BlockPruner将每个Transformer层分割为MHA和MLP块。然后,它使用困惑度度量评估这些块的重要性,并应用启发式搜索进行迭代剪枝。我们将BlockPruner应用于不同规模和架构的LLMs,并在广泛的下游任务上验证了其性能。实验结果表明,与最先进的基线相比,BlockPruner实现了更细粒度、更有效的剪枝。
引用
@article{arxiv.2406.10594,
title = {BlockPruner: Fine-grained Pruning for Large Language Models},
author = {Longguang Zhong and Fanqi Wan and Ruijun Chen and Xiaojun Quan and Liangzhi Li},
journal= {arXiv preprint arXiv:2406.10594},
year = {2025}
}
备注
ACL 2025 Findings