最优BERT外科医生:面向大语言模型的可扩展精确二阶剪枝
计算与语言
2022-10-19 v3 机器学习
摘要
基于Transformer的语言模型已成为自然语言处理的关键构建模块。尽管这些模型极为准确,但其规模过大且计算密集,难以在标准部署上运行。包括蒸馏、量化、结构化和非结构化剪枝在内的多种压缩方法已知能在低精度损失下减小模型规模并提升推理速度。在此背景下,本文的贡献有两点。我们对BERT模型非结构化权重剪枝的精度-压缩权衡进行了深入研究。我们提出最优BERT外科医生(oBERT),一种基于近似二阶信息的高效精确权重剪枝方法,并展示其在语言任务的两个阶段——预训练与微调——均取得最先进结果。具体而言,oBERT扩展了现有的非结构化二阶剪枝工作,允许对权重块进行剪枝,并可应用于BERT规模。其次,我们研究了在组合多种压缩方法以获得用于边缘设备部署的高度压缩但精确的模型时,该剪枝方法的影响。这些模型在所有指标上显著推进了当前最先进稀疏BERT模型的边界:模型规模、推理速度和任务精度。例如,相对于稠密BERT-base,我们实现了10倍模型规模压缩(以MB计)且精度下降<1%,10倍CPU推理加速且精度下降<2%,以及29倍CPU推理加速且精度下降<7.5%。我们的代码已完全集成于Transformers和SparseML,可在 https://github.com/neuralmagic/sparseml/tree/main/research/optimal_BERT_surgeon_oBERT 获取。
引用
@article{arxiv.2203.07259,
title = {The Optimal BERT Surgeon: Scalable and Accurate Second-Order Pruning for Large Language Models},
author = {Eldar Kurtic and Daniel Campos and Tuan Nguyen and Elias Frantar and Mark Kurtz and Benjamin Fineran and Michael Goin and Dan Alistarh},
journal= {arXiv preprint arXiv:2203.07259},
year = {2022}
}
备注
Accepted to EMNLP 2022