中文

通过文本平滑从预训练语言模型蒸馏知识

计算与语言 2020-05-11 v1 声音 音频与语音处理

摘要

本文研究通过师生知识蒸馏压缩预训练语言模型,如BERT(Devlin et al., 2019)。已有工作通常强制学生模型严格模仿教师BERT预测的平滑标签。作为替代,我们提出一种新的BERT蒸馏方法,即让教师生成平滑的词id而非标签,以在知识蒸馏中教导学生模型。我们称此类方法为文本平滑(TextSmoothing)。实践中,我们使用BERT中掩码语言模型(MLM)的softmax预测为给定文本生成词分布,并利用预测得到的软词id平滑那些输入文本。我们假设平滑标签与平滑文本均可隐式扩充输入语料,而文本平滑直观上更高效,因其可在一次神经网络前向步骤中生成更多实例。在GLUE与SQuAD上的实验结果表明,相较于已有BERT蒸馏方法,我们的方案能取得有竞争力的结果。

关键词

引用

@article{arxiv.2005.03848,
  title  = {Distilling Knowledge from Pre-trained Language Models via Text Smoothing},
  author = {Xing Wu and Yibing Liu and Xiangyang Zhou and Dianhai Yu},
  journal= {arXiv preprint arXiv:2005.03848},
  year   = {2020}
}

备注

5 pages, 2 figures