EfficientBERT:通过预热知识蒸馏渐进搜索多层感知机
计算与语言
2021-09-17 v2 人工智能
机器学习
摘要
预训练语言模型在各种 NLP 任务上展现了显著的效果。然而,由于其庞大的规模和缓慢的推理速度,难以在边缘设备上部署。在本文中,我们有一个关键见解:改进 BERT 中的前馈网络(FFN)比改进多头注意力(MHA)收益更高,因为 FFN 的计算成本是 MHA 的 23 倍。因此,为压缩 BERT,我们致力于设计高效的 FFN,而非先前关注 MHA 的工作。由于 FFN 包含对 BERT 优化至关重要的多层感知机(MLP),我们进一步设计了一个面向先进 MLP 的详尽搜索空间,并采用由粗到细的机制来搜索高效的 BERT 架构。此外,为加速搜索并增强模型可迁移性,我们在每个搜索阶段采用一种新颖的预热知识蒸馏策略。大量实验表明,我们搜索得到的 EfficientBERT 比 BERT 小 6.9、快 4.4,并在 GLUE 和 SQuAD 基准上具有有竞争力的性能。具体而言,EfficientBERT 在 GLUE \emph{test} 上取得 77.7 的平均分,比 MobileBERT 高 0.7,并在 SQuAD v1.1/v2.0 \emph{dev} 上取得 85.3/74.5 的 F1 分数,比 TinyBERT 高 3.2/2.7,即便未使用数据增强。代码发布于 https://github.com/cheneydon/efficient-bert。
引用
@article{arxiv.2109.07222,
title = {EfficientBERT: Progressively Searching Multilayer Perceptron via Warm-up Knowledge Distillation},
author = {Chenhe Dong and Guangrun Wang and Hang Xu and Jiefeng Peng and Xiaozhe Ren and Xiaodan Liang},
journal= {arXiv preprint arXiv:2109.07222},
year = {2021}
}
备注
Findings of EMNLP 2021