中文

无需直通估计器 (STE) 的低精度神经网络学习

机器学习 2019-05-22 v2 机器学习

摘要

直通估计器 (STE) 被广泛用于通过量化函数反向传播梯度,但 STE 技术缺乏完整的理论理解。我们提出了一种称为 alpha 混合 (AB) 的替代方法,该方法使用随机梯度下降 (SGD) 将神经网络量化为低精度。我们的方法 (AB) 通过用量化权重 wqw_q 和相应的全精度权重 ww 的仿射组合(带有不可训练的标量系数 α\alpha1α1-\alpha)替换损失函数中的量化权重,从而避免了 STE 近似。在训练过程中,α\alpha 从 0 逐渐增加到 1;对权重的梯度更新通过仿射组合中的全精度项 (1α)w(1-\alpha)w 进行;模型从全精度逐步转换为低精度。为了评估该方法,使用 alpha 混合方法在 CIFAR10 数据集上训练了 1 位 BinaryNet,并在 ImageNet 数据集上训练了 8 位、4 位的 MobileNet v1 和 ResNet_50 v1/2,评估表明,与基于 STE 的量化结果相比,AB 分别将 top-1 准确率提高了 0.9%、0.82% 和 2.93%。

关键词

引用

@article{arxiv.1903.01061,
  title  = {Learning low-precision neural networks without Straight-Through Estimator(STE)},
  author = {Zhi-Gang Liu and Matthew Mattina},
  journal= {arXiv preprint arXiv:1903.01061},
  year   = {2019}
}

备注

conference version accepted by IJCAI-2019