一次剪枝通用:稀疏预训练语言模型
计算与语言
2021-11-11 v1 人工智能
机器学习
摘要
基于 Transformer 的语言模型被应用于自然语言处理中的广泛任务。然而,它们效率低下且难以部署。近年来,人们提出了许多压缩算法,以提升大型基于 Transformer 的模型在目标硬件上的实现效率。在本工作中,我们提出一种通过整合权重剪枝与模型蒸馏来训练稀疏预训练 Transformer 语言模型的新方法。这些稀疏预训练模型可用于广泛任务的迁移学习,同时保持其稀疏模式。我们用三种已知架构演示了该方法,创建了稀疏预训练的 BERT-Base、BERT-Large 与 DistilBERT。我们展示了我们所训练的压缩稀疏预训练模型如何以最小的精度损失将知识迁移到五个不同的下游自然语言任务。此外,我们展示了如何使用量化感知训练将稀疏模型权重进一步压缩至 8 位精度。例如,我们的稀疏预训练 BERT-Large 在 SQuADv1.1 上微调并量化至 8 位后,编码器实现了 X 的压缩比,精度损失小于 。据我们所知,我们的结果展示了 BERT-Base、BERT-Large 与 DistilBERT 的最佳压缩-精度比。
引用
@article{arxiv.2111.05754,
title = {Prune Once for All: Sparse Pre-Trained Language Models},
author = {Ofir Zafrir and Ariel Larey and Guy Boudoukh and Haihao Shen and Moshe Wasserblat},
journal= {arXiv preprint arXiv:2111.05754},
year = {2021}
}
备注
ENLSP NeurIPS Workshop 2021, 12 pages