分而治之:利用中间特征表示进行神经网络量化训练
机器学习
2020-03-04 v4 机器学习
摘要
现代神经网络的深层随着输入在网络中传播会提取出相当丰富的特征集合。本文着手以最小的准确率损失来利用这些丰富的中间表示进行量化,同时显著减少 DNN 的内存占用和计算强度。本文在一种新颖的设置中利用教师-学生范式(Hinton et al., 2015)的知识蒸馏,该设置挖掘 DNN 的特征提取能力以实现更高精度的量化。因此,我们的算法将一个预训练的全精度 DNN 逻辑上划分为多个段,每一段暴露中间特征以在量化域中独立训练一组学生。这种分而治之策略实际上使得每个学生在隔离状态下训练成为可能,而这些独立训练的段随后被拼接在一起形成等效的全量化网络。我们的算法是一种针对知识蒸馏的分段方法,而非将中间表示作为在整个网络进行一次知识蒸馏之前的预训练提示(Romero et al., 2015)。在多种 DNN(AlexNet、LeNet、MobileNet、ResNet-18、ResNet-20、SVHN 和 VGG-11)上的实验表明,这种方法——称为 DCQ(Divide and Conquer Quantization,分而治之量化)——平均而言,对于二值和三值量化,分别将最先进的量化训练技术 DoReFa-Net(Zhou et al., 2016)的性能提高了 21.6% 和 9.3%。此外,我们展示了将 DCQ 结合到现有量化训练方法中可带来比先前多个最先进量化训练方法所报告的更高的准确率。
引用
@article{arxiv.1906.06033,
title = {Divide and Conquer: Leveraging Intermediate Feature Representations for Quantized Training of Neural Networks},
author = {Ahmed T. Elthakeb and Prannoy Pilligundla and Alex Cloninger and Hadi Esmaeilzadeh},
journal= {arXiv preprint arXiv:1906.06033},
year = {2020}
}