使用权重和激活低比特宽度的卷积神经网络的有效训练
计算机视觉与模式识别
2021-06-07 v3
摘要
本文解决了训练权重和激活均为低比特宽度的深度卷积神经网络的问题。由于量化器的不可微性,优化低精度网络非常具有挑战性,这可能导致显著的精度损失。为了解决这个问题,我们提出了三种实用方法,包括(i)渐进式量化;(ii)随机精度;以及(iii)联合知识蒸馏以改进网络训练。首先,对于渐进式量化,我们提出两种方案来逐步找到良好的局部极小值。具体而言,我们提出首先优化具有量化权重的网络,随后量化激活。这与同时优化它们的传统方法形成对比。此外,我们提出第二种渐进式量化方案,在训练期间将比特宽度从高精度逐步降低到低精度。其次,为了减轻由于多轮训练阶段带来的过多训练负担,我们进一步提出一种单阶段随机精度策略,随机采样并量化子网络,同时将其他部分保持为全精度。最后,我们采用一种新颖的学习方案,与低精度模型一起联合训练全精度模型。通过这样做,全精度模型提供提示以指导低精度模型训练,并显著提高了低精度网络的性能。在各种数据集(例如CIFAR-100、ImageNet)上的大量实验显示了所提方法的有效性。
引用
@article{arxiv.1908.04680,
title = {Effective Training of Convolutional Neural Networks with Low-bitwidth Weights and Activations},
author = {Bohan Zhuang and Jing Liu and Mingkui Tan and Lingqiao Liu and Ian Reid and Chunhua Shen},
journal= {arXiv preprint arXiv:1908.04680},
year = {2021}
}
备注
Accepted to IEEE T. Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:1711.00205 (CVPR 2018)