随机精度集成:面向量化深度神经网络的自知识蒸馏
机器学习
2020-10-01 v1 机器学习
摘要
深度神经网络量化(QDNN)已得到积极研究以部署于边缘设备。近期研究采用知识蒸馏(KD)方法提升量化网络性能。本研究提出面向QDNN的随机精度集成训练(SPEQ)。SPEQ是一种知识蒸馏训练方案;然而,教师网络通过共享学生网络的模型参数构成。我们在前向计算中对每层的激活比特精度进行随机改变,从而获得教师网络的软标签。学生模型利用这些软标签训练以减小激活量化噪声。KD训练采用余弦相似度损失替代KL散度。由于教师模型通过随机比特精度分配持续变化,其利用了随机集成KD的效果。SPEQ在图像分类、问答和迁移学习等多种任务中优于现有量化训练方法,且无需繁琐的教师网络。
引用
@article{arxiv.2009.14502,
title = {Stochastic Precision Ensemble: Self-Knowledge Distillation for Quantized Deep Neural Networks},
author = {Yoonho Boo and Sungho Shin and Jungwook Choi and Wonyong Sung},
journal= {arXiv preprint arXiv:2009.14502},
year = {2020}
}