面向量化深度神经网络优化的知识蒸馏
机器学习
2019-10-24 v3 机器学习
摘要
知识蒸馏(KD)是一种非常流行的模型尺寸缩减方法。近来,该技术被用于在量化深度神经网络(QDNNs)训练中,作为恢复因字长缩减而牺牲的性能的一种手段。然而,KD 为 QDNN 训练引入了额外的超参数,如温度、系数以及教师网络的大小。我们分析了这些超参数对使用 KD 的 QDNN 优化的影响。我们发现这些超参数是相互关联的,并且还引入了一种简单而有效的技术,在训练过程中降低 \textit{系数}。采用所提超参数的 KD,我们在 Resnet20 上使用 2-bit 三元权重分别在 CIFAR-10 和 CIFAR-100 数据集上取得了 92.7% 和 67.0% 的测试准确率。
引用
@article{arxiv.1909.01688,
title = {Knowledge distillation for optimization of quantized deep neural networks},
author = {Sungho Shin and Yoonho Boo and Wonyong Sung},
journal= {arXiv preprint arXiv:1909.01688},
year = {2019}
}