中文

面向高效语言建模的Transformer注意力头逐层剪枝

计算与语言 2021-10-08 v1

摘要

尽管基于Transformer的模型展现出了令人印象深刻的语言建模性能,但其巨大的计算成本往往令实际应用难以承受。注意力头剪枝通过移除多头注意力中不必要的注意力头,是解决该问题的一种有前景的技术。然而,它并不能均匀地降低整体负载,因为庞大的前馈模块不受头剪枝影响。在本文中,我们对全注意力Transformer(All-attention Transformer)应用逐层注意力头剪枝,使得整体计算量和参数量能够按被剪枝头的数量成比例地减少。虽然该架构有潜力充分利用头剪枝,我们提出了三种训练方法,特别有助于最小化性能退化并稳定剪枝过程。在WikiText-103语言建模基准上,我们的剪枝模型在可比参数量下展现出持续低于Transformer-XL的困惑度。

关键词

引用

@article{arxiv.2110.03252,
  title  = {Layer-wise Pruning of Transformer Attention Heads for Efficient Language Modeling},
  author = {Kyuhong Shim and Iksoo Choi and Wonyong Sung and Jungwook Choi},
  journal= {arXiv preprint arXiv:2110.03252},
  year   = {2021}
}