SKDBERT:通过随机知识蒸馏压缩 BERT
计算与语言
2022-11-30 v2
摘要
本文中,我们提出随机知识蒸馏(SKD)以获得紧凑的 BERT 风格语言模型,称为 SKDBERT。在每次迭代中,SKD 从预定义的教师集成中采样一个教师模型,该集成由多个具有多级容量的教师模型组成,以一对一方式将知识迁移至学生模型。采样分布在 SKD 中起着重要作用。我们启发式地提出三类采样分布,为多级教师模型分配适当的概率。SKD 有两个优势:1)它可通过在每次迭代中随机采样单一教师模型来保持多级教师模型的多样性;2)当教师模型与学生模型之间存在较大容量差距时,它还能通过多级教师模型提升知识蒸馏的效率。在 GLUE 基准上的实验结果表明,SKDBERT 将 BERT 模型的尺寸缩减 40%,同时保留 99.5% 的语言理解性能且速度提升 100%。
引用
@article{arxiv.2211.14466,
title = {SKDBERT: Compressing BERT via Stochastic Knowledge Distillation},
author = {Zixiang Ding and Guoqing Jiang and Shuai Zhang and Lin Guo and Wei Lin},
journal= {arXiv preprint arXiv:2211.14466},
year = {2022}
}
备注
This paper has been accepted by AAAI2023