中文

预训练语言模型上面向梯度的注意力内部剪枝

计算与语言 2023-05-19 v2

摘要

预训练语言模型取得了优越性能,但计算代价高昂。诸如剪枝与知识蒸馏等技术已被开发以减小其规模与延迟。本工作中,我们提出一种结构化剪枝方法 GRAIN(基于梯度的注意力内部剪枝),其通过知识蒸馏执行任务特定剪枝并产出高效模型。不同于将每个注意力头整体剪枝的常规方法,GRAIN 检查并剪枝注意力内部结构,极大扩展了结构搜索空间并实现了更灵活的模型。我们还提出一种梯度分离策略,以减少蒸馏对剪枝的干扰,从而更好地结合这两种方法。在 GLUE、SQuAD 和 CoNLL 2003 上的实验表明,GRAIN 显著优于其他方法,尤其在高稀疏度 regime 下,并在保持 93%99%93\%\sim99\% 性能的同时实现了 67×6\sim7\times 加速。在仅保留 3%3\% transformer 权重的极端压缩下,剪枝后的模型与更大的模型相比仍具竞争力。

关键词

引用

@article{arxiv.2212.07634,
  title  = {Gradient-based Intra-attention Pruning on Pre-trained Language Models},
  author = {Ziqing Yang and Yiming Cui and Xin Yao and Shijin Wang},
  journal= {arXiv preprint arXiv:2212.07634},
  year   = {2023}
}

备注

Accepted to ACL 2023