MobileBERT:一种面向资源受限设备的紧凑型任务无关 BERT
计算与语言
2020-04-16 v2 机器学习
摘要
自然语言处理(NLP)近期通过使用具有数亿参数的巨型预训练模型取得了巨大成功。然而,这些模型存在模型尺寸大、延迟高的问题,无法部署到资源受限的移动设备。本文中,我们提出 MobileBERT 以压缩并加速流行的 BERT 模型。与原始 BERT 一样,MobileBERT 是任务无关的,即它可通过简单微调泛化地应用于各种下游 NLP 任务。基本上,MobileBERT 是 BERT_LARGE 的薄版,同时配备了瓶颈结构以及精心设计的自注意力与前馈网络之间的平衡。为训练 MobileBERT,我们首先训练一个特别设计的教师模型,即融合了反向瓶颈的 BERT_LARGE 模型。然后,我们将知识从该教师迁移到 MobileBERT。实证研究表明,MobileBERT 比 BERT_BASE 小 4.3 倍、快 5.5 倍,同时在知名基准上取得有竞争力的结果。在 GLUE 的自然语言推断任务上,MobileBERT 取得 77.7 的 GLUEscore(比 BERT_BASE 低 0.6),在 Pixel 4 手机上延迟 62 ms。在 SQuAD v1.1/v2.0 问答任务上,MobileBERT 取得 90.0/79.2 的开发集 F1 分数(比 BERT_BASE 高 1.5/2.1)。
引用
@article{arxiv.2004.02984,
title = {MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devices},
author = {Zhiqing Sun and Hongkun Yu and Xiaodan Song and Renjie Liu and Yiming Yang and Denny Zhou},
journal= {arXiv preprint arXiv:2004.02984},
year = {2020}
}
备注
Accepted to ACL 2020