通过文本平滑从预训练语言模型蒸馏知识
计算与语言
2020-05-11 v1 声音
音频与语音处理
摘要
本文研究通过师生知识蒸馏压缩预训练语言模型,如BERT(Devlin et al., 2019)。已有工作通常强制学生模型严格模仿教师BERT预测的平滑标签。作为替代,我们提出一种新的BERT蒸馏方法,即让教师生成平滑的词id而非标签,以在知识蒸馏中教导学生模型。我们称此类方法为文本平滑(TextSmoothing)。实践中,我们使用BERT中掩码语言模型(MLM)的softmax预测为给定文本生成词分布,并利用预测得到的软词id平滑那些输入文本。我们假设平滑标签与平滑文本均可隐式扩充输入语料,而文本平滑直观上更高效,因其可在一次神经网络前向步骤中生成更多实例。在GLUE与SQuAD上的实验结果表明,相较于已有BERT蒸馏方法,我们的方案能取得有竞争力的结果。
引用
@article{arxiv.2005.03848,
title = {Distilling Knowledge from Pre-trained Language Models via Text Smoothing},
author = {Xing Wu and Yibing Liu and Xiangyang Zhou and Dianhai Yu},
journal= {arXiv preprint arXiv:2005.03848},
year = {2020}
}
备注
5 pages, 2 figures