MiniLM:用于预训练Transformer任务无关压缩的深度自注意力蒸馏
计算与语言
2020-04-07 v2
摘要
预训练语言模型(例如BERT (Devlin et al., 2018)及其变体)在各种NLP任务中取得了显著成功。然而,这些模型通常包含数亿参数,由于延迟和容量限制,给实际应用场景中的微调和在线服务带来了挑战。在这项工作中,我们提出了一种简单而有效的方法来压缩基于大型Transformer (Vaswani et al., 2017)的预训练模型,称为深度自注意力蒸馏。小模型(学生)通过深度模仿大模型(教师)中在Transformer网络中起关键作用的自注意力模块来进行训练。具体而言,我们提出蒸馏教师最后一个Transformer层的自注意力模块,这对学生而言是有效且灵活的。此外,除了现有工作中使用的注意力分布(即查询与键的缩放点积)之外,我们引入自注意力模块中值之间的缩放点积作为新的深度自注意力知识。而且,我们表明引入教师助理 (Mirzadeh et al., 2019)也有助于大型预训练Transformer模型的蒸馏。实验结果表明,我们的单语模型在不同参数规模的学生模型中均优于最先进的基线。特别地,在使用教师模型50%的Transformer参数和计算量的情况下,它在SQuAD 2.0和若干GLUE基准任务上保留了超过99%的准确率。我们在将深度自注意力蒸馏应用于多语预训练模型时也获得了有竞争力的结果。
引用
@article{arxiv.2002.10957,
title = {MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained Transformers},
author = {Wenhui Wang and Furu Wei and Li Dong and Hangbo Bao and Nan Yang and Ming Zhou},
journal= {arXiv preprint arXiv:2002.10957},
year = {2020}
}
备注
Code and models: https://github.com/microsoft/unilm/tree/master/minilm