中文

变分学生:在知识蒸馏框架中学习紧凑且更稀疏的网络

机器学习 2019-10-29 v1 机器学习

摘要

深度神经网络研究的圣杯是在嵌入式平台上部署内存与计算密集型的网络模型,同时使模型精度妥协最小。为此,我们提出了一种称为变分学生(Variational Student)的新方法,该方法利用了知识蒸馏(KD)框架的可压缩性优势以及变分推断(VI)技术的稀疏性诱导能力。本质上,我们构建了一个稀疏的学生网络,其稀疏性由基于 VI 优化损失函数所得到的变分参数诱导,并借助一个精确但复杂的预训练教师网络所学的知识。此外,为了增强稀疏性,我们还在教师与学生网络权重的拼接张量上采用了块稀疏正则化器(Block Sparse Regularizer)。我们证明了 KD 与 VI 技术的结合从 KD 框架继承了压缩特性,并从 VI 方法提升了稀疏程度,且模型精度妥协极小。我们在 LeNet MLP 和 VGGNet(CNN)上基准测试了我们的结果,并分别在 MLP 和 CNN 变体上展示了 64 倍和 213 倍的内存占用减少,且无需重新训练教师网络。此外,在低数据场景下,我们观察到我们的方法在精度上优于最先进的贝叶斯技术。

关键词

引用

@article{arxiv.1910.12061,
  title  = {Variational Student: Learning Compact and Sparser Networks in Knowledge Distillation Framework},
  author = {Srinidhi Hegde and Ranjitha Prasad and Ramya Hebbalaguppe and Vishwajith Kumar},
  journal= {arXiv preprint arXiv:1910.12061},
  year   = {2019}
}