用于 BERT 模型压缩的耐心知识蒸馏
计算与语言
2019-08-27 v1 机器学习
摘要
诸如 BERT 之类的预训练语言模型已被证明对自然语言处理(NLP)任务极为有效。然而,训练此类模型对计算资源的高需求阻碍了其实际应用。为缓解大规模模型训练中的这种资源渴求,我们提出一种耐心知识蒸馏(Patient Knowledge Distillation)方法,将原始大模型(教师)压缩为同样有效的轻量级浅层网络(学生)。与以往仅利用教师网络最后一层输出进行蒸馏的知识蒸馏方法不同,我们的学生模型依据两种策略耐心地从教师模型的多个中间层学习以实现增量知识提取:()PKD-Last:从最后 层学习;()PKD-Skip:从每隔 层学习。这两种耐心蒸馏方案能够利用教师隐藏层中的丰富信息,并鼓励学生在多层蒸馏过程中耐心地向教师学习并加以模仿。经验上,这转化为在多个 NLP 任务上以训练效率的显著提升而获得改进的结果,且不牺牲模型精度。
引用
@article{arxiv.1908.09355,
title = {Patient Knowledge Distillation for BERT Model Compression},
author = {Siqi Sun and Yu Cheng and Zhe Gan and Jingjing Liu},
journal= {arXiv preprint arXiv:1908.09355},
year = {2019}
}
备注
Accepted to EMNLP 2019