中文

EfficientBERT:通过预热知识蒸馏渐进搜索多层感知机

计算与语言 2021-09-17 v2 人工智能 机器学习

摘要

预训练语言模型在各种 NLP 任务上展现了显著的效果。然而,由于其庞大的规模和缓慢的推理速度,难以在边缘设备上部署。在本文中,我们有一个关键见解:改进 BERT 中的前馈网络(FFN)比改进多头注意力(MHA)收益更高,因为 FFN 的计算成本是 MHA 的 2\sim3 倍。因此,为压缩 BERT,我们致力于设计高效的 FFN,而非先前关注 MHA 的工作。由于 FFN 包含对 BERT 优化至关重要的多层感知机(MLP),我们进一步设计了一个面向先进 MLP 的详尽搜索空间,并采用由粗到细的机制来搜索高效的 BERT 架构。此外,为加速搜索并增强模型可迁移性,我们在每个搜索阶段采用一种新颖的预热知识蒸馏策略。大量实验表明,我们搜索得到的 EfficientBERT 比 BERTBASE\rm_{BASE} 小 6.9×\times、快 4.4×\times,并在 GLUE 和 SQuAD 基准上具有有竞争力的性能。具体而言,EfficientBERT 在 GLUE \emph{test} 上取得 77.7 的平均分,比 MobileBERTTINY\rm_{TINY} 高 0.7,并在 SQuAD v1.1/v2.0 \emph{dev} 上取得 85.3/74.5 的 F1 分数,比 TinyBERT4_4 高 3.2/2.7,即便未使用数据增强。代码发布于 https://github.com/cheneydon/efficient-bert。

关键词

引用

@article{arxiv.2109.07222,
  title  = {EfficientBERT: Progressively Searching Multilayer Perceptron via Warm-up Knowledge Distillation},
  author = {Chenhe Dong and Guangrun Wang and Hang Xu and Jiefeng Peng and Xiaozhe Ren and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2109.07222},
  year   = {2021}
}

备注

Findings of EMNLP 2021