基于粗梯度法的量化神经网络非线性分类学习
机器学习
2021-06-15 v2
摘要
量化或低比特神经网络因其推理效率而具吸引力。然而,训练具有量化激活的深度神经网络涉及最小化一个不连续且分段常数的损失函数。此类损失函数几乎处处(a.e.)梯度为零,使常规基于梯度的算法不适用。为此,我们研究一类新颖的\emph{有偏}一阶预言,称为粗梯度,以克服梯度消失问题。粗梯度通过在链式法则中将量化(即阶梯型)ReLU 激活的 a.e. 零导数替换为某种启发式代理导数(称为直通估计器(STE))而生成。尽管 STE 技巧已在量化网络训练中被广泛经验使用,但诸如其何时及为何奏效等基本问题仍缺乏理论理解。本文提出一类具有某种单调性的 STE,并考虑其在带量化激活函数的双层线性网络训练中以用于非线性多类分类的应用。我们通过证明相应的粗梯度方法收敛至全局极小(从而实现完美分类)来建立所提 STE 的性能保证。最后,我们在合成数据及 MNIST 数据集上给出实验结果,以验证理论发现并展示所提 STE 的有效性。
引用
@article{arxiv.2011.11256,
title = {Learning Quantized Neural Nets by Coarse Gradient Method for Non-linear Classification},
author = {Ziang Long and Penghang Yin and Jack Xin},
journal= {arXiv preprint arXiv:2011.11256},
year = {2021}
}