MiniLMv2:用于压缩预训练Transformer的多头自注意力关系蒸馏
计算与语言
2021-06-29 v2
摘要
我们通过仅使用自注意力关系蒸馏来进行预训练Transformer的任务无关压缩,推广了MiniLM(Wang等人,2020)中的深度自注意力蒸馏。具体而言,我们将多头自注意力关系定义为每个自注意力模块内查询、键和值向量对之间的缩放点积。然后我们利用上述关系知识来训练学生模型。除了其简单性和统一原则外,更有利的是,对学生注意力头的数量没有限制,而大多数先前的工作必须保证教师和学生之间头数相同。此外,细粒度的自注意力关系倾向于充分利用Transformer学习到的交互知识。另外,我们彻底考察了教师模型的层选择策略,而非像MiniLM中仅依赖最后一层。我们在压缩单语和多语预训练模型方面进行了大量实验。实验结果表明,我们从基础规模和大型规模教师(BERT、RoBERTa和XLM-R)蒸馏出的模型优于最先进的模型。
引用
@article{arxiv.2012.15828,
title = {MiniLMv2: Multi-Head Self-Attention Relation Distillation for Compressing Pretrained Transformers},
author = {Wenhui Wang and Hangbo Bao and Shaohan Huang and Li Dong and Furu Wei},
journal= {arXiv preprint arXiv:2012.15828},
year = {2021}
}
备注
Monolingual and multilingual distilled models: https://github.com/microsoft/unilm/tree/master/minilm