中文

Pea-KD:基于 BERT 的参数高效且精确的知识蒸馏

机器学习 2020-12-14 v2 机器学习

摘要

我们如何能在保持模型性能的同时高效地压缩模型?知识蒸馏(KD)是众所周知的模型压缩方法之一。本质上,KD 基于更大的教师模型训练一个更小的学生模型,并尽可能保留教师模型的性能水平。然而,现有的 KD 方法存在以下局限。首先,由于学生模型的绝对规模较小,其模型容量先天不足。其次,学生模型缺乏初始引导,难以充分模仿教师模型。传统的 KD 方法因这些局限而性能较低。本文中,我们提出 Pea-KD(Parameter-efficient and accurate Knowledge Distillation,参数高效且精确的知识蒸馏),一种新颖的 KD 方法。Pea-KD 由两部分组成:混洗参数共享(SPS)和利用教师预测的预训练(PTP)。通过这一组合,我们能够缓解 KD 的局限。SPS 是一种新的参数共享方法,可增加学生模型容量。PTP 是一种 KD 专用的初始化方法,可作为学生的良好初始引导。二者结合显著提升了学生模型的性能。在 BERT 上针对不同数据集和任务进行的实验表明,所提方法在四项 GLUE 任务上使学生模型性能平均提升 4.4%,以显著优势超越现有 KD 基线。

关键词

引用

@article{arxiv.2009.14822,
  title  = {Pea-KD: Parameter-efficient and Accurate Knowledge Distillation on BERT},
  author = {Ikhyun Cho and U Kang},
  journal= {arXiv preprint arXiv:2009.14822},
  year   = {2020}
}

备注

10 pages