中文

LLM自注意力层的数据免除剪枝

机器学习 2025-12-25 v1 人工智能

摘要

许多大型语言模型(LLM)中的自注意力子层可以被移除而损失很小或没有损失。我们将此归因于注意力抑制假设:在预训练期间,一些深层注意力层学习到静默其自身贡献的能力,使残差流和MLP承担表示。我们提出了Gate-Norm,一种一次性、仅基于权重的判据,用于对注意力子层进行排序并移除关联性最弱的层,无需校准数据、前向传播、微调或专用内核。在40层、13B参数的LLaMA模型上,Gate-Norm可在不到一秒的时间内完成剪枝。剪除8-16个注意力子层,可实现最高1.30倍的推理吞吐量提升,同时在BoolQ、RTE、HellaSwag、WinoGrande、ARC-Easy/Challenge和OpenBookQA等任务上,将平均零样本准确率保持在未剪枝基线的2%以内。在这些设置下,Gate-Norm在准确率上与数据驱动型剪枝方法相当,而速度快约1000倍,使其能够实现LLM的实用、数据免除压缩。

关键词

引用

@article{arxiv.2512.20636,
  title  = {Data-Free Pruning of Self-Attention Layers in LLMs},
  author = {Dhananjay Saikumar and Blesson Varghese},
  journal= {arXiv preprint arXiv:2512.20636},
  year   = {2025}
}