用于深度神经网络全量化的混合粗梯度下降法
机器学习
2019-01-08 v4 计算机视觉与模式识别
机器学习
摘要
量化深度神经网络(QDNNs)因其比常规全精度网络更低的内存占用和更快的推理速度而颇具吸引力。为保持同等性能水平,尤其在低比特宽度下,QDNNs必须被重新训练。其训练涉及分段常数激活函数与离散权重,因而产生数学挑战。我们引入粗梯度的概念,并提出混合粗梯度下降(BCGD)算法,用于训练全量化神经网络。粗梯度一般不是任何函数的梯度,而是一种人为的上升方向。BCGD的权重更新通过对全精度权重及其量化(即所谓混合)的加权平均进行粗梯度修正来实现,这能在目标值上产生足够的下降,从而加速训练。我们的实验表明,这种简单的混合技术在极低比特宽度(如二值化)量化中非常有效。在ResNet-18用于ImageNet分类任务的全量化中,BCGD在所有层使用二值权重和4-bit自适应激活时给出64.36%的top-1准确率。若保持首层和末层权重为全精度,该数值升至65.46%。作为理论依据,我们给出了具有高斯输入数据的双线性层神经网络模型的粗梯度下降收敛性分析,并证明期望粗梯度与底层真实梯度正相关。
引用
@article{arxiv.1808.05240,
title = {Blended Coarse Gradient Descent for Full Quantization of Deep Neural Networks},
author = {Penghang Yin and Shuai Zhang and Jiancheng Lyu and Stanley Osher and Yingyong Qi and Jack Xin},
journal= {arXiv preprint arXiv:1808.05240},
year = {2019}
}