面向边缘人工智能系统的自动高效 BERT 剪枝方法
计算与语言
2022-06-22 v1 人工智能
摘要
随着对深度学习民主化的渴望,在资源受限设备上实现基于 Transformer 的自然语言处理(NLP)模型以满足低延迟和高精度的需求日益增长。现有的 BERT 剪枝方法需要领域专家启发式地手工设计超参数,以在模型大小、延迟和精度之间取得平衡。在本工作中,我们提出 AE-BERT,一种自动且高效的 BERT 剪枝框架,通过高效评估在给定的整体剪枝率约束下选择“良好”的子网络候选(具有高准确率)。我们提出的方法无需人类专家经验,并在许多 NLP 任务上取得更好的准确率表现。我们在通用语言理解评估(GLUE)基准上的实验结果表明,AE-BERT 在 BERT 上优于最先进的(SOTA)手工剪枝方法。在 QNLI 和 RTE 上,我们在获得更高准确率的同时分别实现了 75% 和 42.8% 更高的整体剪枝率。在 MRPC 上,我们在相同的 0.5 整体剪枝率下比 SOTA 高出 4.6 分。在 STS-B 上,与 SOTA 手工剪枝方法相比,我们能在 Spearman 相关性极小损失下实现 40% 更高的剪枝率。实验结果还表明,模型压缩后,单个 BERT 编码器在 Xilinx Alveo U200 FPGA 板上的推理时间相比 Intel(R) Xeon(R) Gold 5218(2.30GHz)CPU 有 1.83 加速,这表明将所提方法生成的 BERT 模型子网络部署在计算受限设备上是合理的。
引用
@article{arxiv.2206.10461,
title = {An Automatic and Efficient BERT Pruning for Edge AI Systems},
author = {Shaoyi Huang and Ning Liu and Yueying Liang and Hongwu Peng and Hongjia Li and Dongkuan Xu and Mimi Xie and Caiwen Ding},
journal= {arXiv preprint arXiv:2206.10461},
year = {2022}
}