中文

面向量化深度神经网络优化的知识蒸馏

机器学习 2019-10-24 v3 机器学习

摘要

知识蒸馏(KD)是一种非常流行的模型尺寸缩减方法。近来,该技术被用于在量化深度神经网络(QDNNs)训练中,作为恢复因字长缩减而牺牲的性能的一种手段。然而,KD 为 QDNN 训练引入了额外的超参数,如温度、系数以及教师网络的大小。我们分析了这些超参数对使用 KD 的 QDNN 优化的影响。我们发现这些超参数是相互关联的,并且还引入了一种简单而有效的技术,在训练过程中降低 \textit{系数}。采用所提超参数的 KD,我们在 Resnet20 上使用 2-bit 三元权重分别在 CIFAR-10 和 CIFAR-100 数据集上取得了 92.7% 和 67.0% 的测试准确率。

关键词

引用

@article{arxiv.1909.01688,
  title  = {Knowledge distillation for optimization of quantized deep neural networks},
  author = {Sungho Shin and Yoonho Boo and Wonyong Sung},
  journal= {arXiv preprint arXiv:1909.01688},
  year   = {2019}
}