中文

LIT:用于模型压缩的分块中间表示训练

机器学习 2018-10-05 v1 人工智能 机器学习

摘要

知识蒸馏(KD)是一种降低深度网络推理计算开销的流行方法,其中利用教师模型的输出来训练更小、更快的学生模型。提示训练(即 FitNets)通过回归学生模型的中间表示到教师模型的中间表示来扩展 KD。在本工作中,我们引入分块中间表示训练(bLock-wise Intermediate representation Training, LIT),一种新颖的模型压缩技术,扩展了深度网络压缩中中间表示的使用,优于 KD 与提示训练。LIT 有两个关键思想:1) LIT 通过直接比较中间表示来训练与教师宽度相同(但深度更浅)的学生;2) LIT 在训练时将教师模型前一块的中间表示作为当前学生块的输入,从而避免学生网络中不稳定的中间表示。我们展示 LIT 在精度不损的前提下大幅缩减网络深度——例如,LIT 可在 CIFAR10 上将 ResNeXt-110 压缩为 ResNeXt-20(5.5倍),在 Amazon Reviews 上将 VDCNN-29 压缩为 VDCNN-9(3.2倍),在给定精度下网络规模优于 KD 与提示训练。我们还展示将 LIT 应用于相同的学生/教师架构可将学生模型精度提升至高于教师模型,在 ResNet、ResNeXt 与 VDCNN 上优于近期提出的 Born Again Networks 方法。最后,我们展示 LIT 可有效压缩 GAN 生成器,而 KD 框架不支持 GAN,因为 GAN 输出像素而非概率。

关键词

引用

@article{arxiv.1810.01937,
  title  = {LIT: Block-wise Intermediate Representation Training for Model Compression},
  author = {Animesh Koratana and Daniel Kang and Peter Bailis and Matei Zaharia},
  journal= {arXiv preprint arXiv:1810.01937},
  year   = {2018}
}