中文

基于谱归一化恒等先验修剪 Transformer 模型中的冗余映射

计算与语言 2020-10-06 v1

摘要

针对 Transformer 模型的传统(非结构化)剪枝方法侧重于通过将各个权重惩罚至零来正则化它们。在本工作中,我们探索谱归一化恒等先验(SNIP),这是一种结构化剪枝方法,将 Transformer 模型中的整个残差模块惩罚至恒等映射。我们的方法通过对函数范数施加阈值算子,识别并丢弃残差连接中不重要的非线性映射。它适用于任何结构化模块,包括单个注意力头、整个注意力块或前馈子网络。此外,我们引入谱归一化来稳定 Transformer 层激活后数值的分布,进一步提升了所提方法的剪枝效果。我们使用 BERT 在 5 个 GLUE 基准任务上进行实验,证明 SNIP 在保持相当性能的同时实现了有效的剪枝结果。具体而言,在 50% 压缩比下,我们的平均性能比最先进水平高出 0.5% 至 1.0%。

关键词

引用

@article{arxiv.2010.01791,
  title  = {Pruning Redundant Mappings in Transformer Models via Spectral-Normalized Identity Prior},
  author = {Zi Lin and Jeremiah Zhe Liu and Zi Yang and Nan Hua and Dan Roth},
  journal= {arXiv preprint arXiv:2010.01791},
  year   = {2020}
}

备注

Findings of EMNLP 2020