面向更快速Transformer的块剪枝
机器学习
2021-09-13 v1 计算与语言
摘要
预训练提高了分类和生成任务的模型准确率,但代价是引入了更大且更慢的模型。剪枝方法已被证明是减小模型大小的有效方法,而蒸馏方法则被证明可以加速推理。我们引入了一种旨在实现既小又快模型的块剪枝方法。我们的方法通过考虑任意大小的块来扩展结构化方法,并将这种结构集成到用于微调的运动剪枝范式中。我们发现这种方法学会了剪枝掉底层模型的完整组件,例如注意力头。实验考虑了分类和生成任务,得出的结果之一是在 SQuAD v1 上得到一个速度快 2.4 倍、体积小 74% 的剪枝 BERT 模型,其 F1 分数下降 1%,在速度上可与蒸馏模型竞争,在大小上可与剪枝模型媲美。
引用
@article{arxiv.2109.04838,
title = {Block Pruning For Faster Transformers},
author = {François Lagunas and Ella Charlaix and Victor Sanh and Alexander M. Rush},
journal= {arXiv preprint arXiv:2109.04838},
year = {2021}
}
备注
EMNLP 2021. Code, hyper-parameters, evaluation results and checkpoints available at https://github.com/huggingface/nn_pruning