中文

Greedy-Gnorm: 一种基于梯度矩阵范数的注意力熵剪枝替代方法

机器学习 2026-02-05 v1

摘要

注意力头剪枝已成为Transformer模型压缩的有效技术,在绿色AI时代这一目标日益重要。然而,现有剪枝方法通常依赖静态重要性分数,无法捕捉迭代移除过程中注意力头角色的动态变化。我们提出Greedy-Gradient norm (Greedy-Gnorm),一种新颖的头剪枝算法,该算法在每次剪枝步骤后动态重新计算头的重要性。具体而言,每个头通过其Q/K/V梯度块的l2范数的逐元素乘积进行评分,该评分基于保留验证集估计并在每次贪婪迭代时更新。这种动态评分方法减轻了排名过时的问题,并更好地反映了剪枝过程中基于梯度的重要性。在BERT、ALBERT、RoBERTa和XLM-RoBERTa上的大量实验表明,Greedy-Gnorm在大量移除注意力头的情况下始终能保持准确率,优于注意力熵方法。通过有效减小模型尺寸同时保持任务性能,Greedy-Gnorm为更节能的Transformer模型部署提供了有前景的一步。

关键词

引用

@article{arxiv.2602.04491,
  title  = {Greedy-Gnorm: A Gradient Matrix Norm-Based Alternative to Attention Entropy for Head Pruning},
  author = {Yuxi Guo and Paul Sheridan},
  journal= {arXiv preprint arXiv:2602.04491},
  year   = {2026}
}

备注

24 pages, 5 figures, 5 tables