无需直通估计器 (STE) 的低精度神经网络学习
机器学习
2019-05-22 v2 机器学习
摘要
直通估计器 (STE) 被广泛用于通过量化函数反向传播梯度,但 STE 技术缺乏完整的理论理解。我们提出了一种称为 alpha 混合 (AB) 的替代方法,该方法使用随机梯度下降 (SGD) 将神经网络量化为低精度。我们的方法 (AB) 通过用量化权重 和相应的全精度权重 的仿射组合(带有不可训练的标量系数 和 )替换损失函数中的量化权重,从而避免了 STE 近似。在训练过程中, 从 0 逐渐增加到 1;对权重的梯度更新通过仿射组合中的全精度项 进行;模型从全精度逐步转换为低精度。为了评估该方法,使用 alpha 混合方法在 CIFAR10 数据集上训练了 1 位 BinaryNet,并在 ImageNet 数据集上训练了 8 位、4 位的 MobileNet v1 和 ResNet_50 v1/2,评估表明,与基于 STE 的量化结果相比,AB 分别将 top-1 准确率提高了 0.9%、0.82% 和 2.93%。
引用
@article{arxiv.1903.01061,
title = {Learning low-precision neural networks without Straight-Through Estimator(STE)},
author = {Zhi-Gang Liu and Matthew Mattina},
journal= {arXiv preprint arXiv:1903.01061},
year = {2019}
}
备注
conference version accepted by IJCAI-2019