中文

贪心层剪枝:加速自然语言处理中的 Transformer 模型

计算与语言 2022-03-30 v2

摘要

在无监督预训练后对 transformer 模型进行微调,可在许多不同的自然语言处理任务上达到非常高的性能。遗憾的是,transformer 存在推理时间长的问题,这大大增加了生产中的成本。一种可能的解决方案是使用知识蒸馏,其通过将信息从大型教师模型迁移到较小学生模型来解决该问题。知识蒸馏保持高性能并实现高压缩率,然而,学生模型的大小在预训练后固定,无法针对给定下游任务和用例进行单独改变以达成所需的性能/加速比。另一种以更细粒度且计算更廉价的方式减小模型规模的方案是在预训练后剪枝层。代价是逐层剪枝算法的性能不及最先进的知识蒸馏方法。本文提出贪心层剪枝(Greedy-layer pruning),以(1)超越当前最先进的逐层剪枝方法,(2)在性能上缩小与知识蒸馏的差距,同时(3)提供一种动态适配模型大小以达成所需性能/加速权衡的方法,且无需额外的预训练阶段。我们的源代码可在 https://github.com/deepopinion/greedy-layer-pruning 获取。

关键词

引用

@article{arxiv.2105.14839,
  title  = {Greedy-layer Pruning: Speeding up Transformer Models for Natural Language Processing},
  author = {David Peer and Sebastian Stabinger and Stefan Engl and Antonio Rodriguez-Sanchez},
  journal= {arXiv preprint arXiv:2105.14839},
  year   = {2022}
}

备注

Accepted at Pattern Recognition Letters