中文

TinyBERT:为自然语言理解蒸馏 BERT

计算与语言 2020-10-19 v5 人工智能 机器学习

摘要

语言模型预训练(如 BERT)显著提升了诸多自然语言处理任务的性能。然而,预训练语言模型通常计算代价高昂,因此难以在资源受限设备上高效执行。为在保持精度的同时加速推理并减小模型规模,我们首先提出一种专为基于 Transformer 的模型知识蒸馏 (KD) 设计的新型 Transformer 蒸馏方法。借助该新 KD 方法,大型教师 BERT 中编码的丰富知识可有效迁移至小型学生 TinyBERT。随后,我们为 TinyBERT 引入新的两阶段学习框架,在预训练与特定任务学习阶段均执行 Transformer 蒸馏。该框架确保 TinyBERT 能捕获 BERT 中的通用领域及任务特定知识。4 层 TinyBERT 经验上有效,在 GLUE 基准上达到其教师 BERTBASE 性能的 96.8% 以上,同时推理时体积缩小 7.5 倍、速度提升 9.4 倍。4 层 TinyBERT 在 BERT 蒸馏上也显著优于 4 层最优基线,仅约为其参数量的 28% 与推理时间的 31%。此外,6 层 TinyBERT 性能与其教师 BERTBASE 相当。

关键词

引用

@article{arxiv.1909.10351,
  title  = {TinyBERT: Distilling BERT for Natural Language Understanding},
  author = {Xiaoqi Jiao and Yichun Yin and Lifeng Shang and Xin Jiang and Xiao Chen and Linlin Li and Fang Wang and Qun Liu},
  journal= {arXiv preprint arXiv:1909.10351},
  year   = {2020}
}

备注

Findings of EMNLP 2020; results have been updated; code and model: https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/TinyBERT