MATE-KD:掩码对抗文本,知识蒸馏的辅助方法
计算与语言
2021-05-14 v1 机器学习
摘要
大型预训练语言模型的出现推动了自然语言处理(NLP)领域的快速进展。尽管这些模型在标准基准上的性能随规模而提升,但知识蒸馏等压缩技术是实现其实际应用的关键。我们提出 MATE-KD,一种新颖的基于文本的对抗训练算法,可提升知识蒸馏的性能。MATE-KD 首先训练一个基于掩码语言模型的生成器,通过最大化教师与学生 logits 之间的散度来扰动文本。然后利用知识蒸馏,在原始与扰动后的训练样本上训练学生模型。我们使用基于 BERT 的模型在 GLUE 基准上评估我们的算法,并证明 MATE-KD 优于具有竞争力的对抗学习与数据增强基线。在 GLUE 测试集上,我们基于 6 层 RoBERTa 的模型优于 BERT-Large。
引用
@article{arxiv.2105.05912,
title = {MATE-KD: Masked Adversarial TExt, a Companion to Knowledge Distillation},
author = {Ahmad Rashid and Vasileios Lioutas and Mehdi Rezagholizadeh},
journal= {arXiv preprint arXiv:2105.05912},
year = {2021}
}
备注
Accepted at ACL 2021