理解训练激活量化神经网络中的直通估计器
机器学习
2019-09-26 v4 最优化与控制
机器学习
摘要
训练激活量化神经网络涉及最小化一个几乎处处梯度消失的分段常数函数,这不利于标准反向传播或链式法则。对此问题的一个经验性绕行方法是在反向传播中仅使用直通估计器(STE)(Bengio et al., 2013),使得经修正链式法则得到的“梯度”变得非平凡。由于此不寻常的“梯度”显然不是损失函数的梯度,如下问题随之而来:为何在其负方向搜索能最小化训练损失?本文通过回答该问题给出 STE 概念的理论依据。我们考虑带二值化 ReLU 激活与高斯输入数据的两线性层网络的学习问题。我们将 STE 修正链式法则给出的不寻常“梯度”称为粗梯度。STE 的选择并不唯一。我们证明若 STE 选取恰当,期望粗梯度与总体梯度(训练中不可得)正相关,且其负值最小化总体损失是一个下降方向。我们进一步展示相应的粗梯度下降算法收敛到总体损失最小化问题的临界点。此外,我们展示不当的 STE 选择会导致训练算法在某些局部极小附近的不稳定,这一点由 CIFAR-10 实验验证。
引用
@article{arxiv.1903.05662,
title = {Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets},
author = {Penghang Yin and Jiancheng Lyu and Shuai Zhang and Stanley Osher and Yingyong Qi and Jack Xin},
journal= {arXiv preprint arXiv:1903.05662},
year = {2019}
}
备注
in International Conference on Learning Representations (ICLR) 2019