一种用于学习稀疏权重二值化激活神经网络的松弛变量分裂粗梯度下降方法的收敛性
最优化与控制
2019-02-12 v2
摘要
神经网络稀疏化是提高效率与泛化能力的有效复杂度降低方法之一。二值化激活为推理提供了额外的计算节省。由于在训练具有二值化激活的网络中存在梯度消失问题,实践中采用了粗梯度(又称 straight through estimator)。本文研究具有二值化激活函数和稀疏权重的单隐藏层卷积神经网络(CNN)的粗梯度下降(CGD)学习问题。已知当输入数据服从高斯分布时,在无重叠单隐藏层 ReLU 激活且权重任意的 CNN 中,可通过 GD 以高概率在多项式时间内学习回归问题中的真实值。我们提出一种结合阈值化与粗梯度下降的松弛变量分裂方法。网络权重的稀疏性通过在 CGD 训练过程中的阈值化实现。我们证明在 及变换 惩罚的阈值化下,无重叠二值激活 CNN 可以高概率被学习,且迭代权重收敛到一个全局极限,该极限是在一种新颖稀疏化操作下真实权重的变换。我们给出了稀疏权重相对真实权重的显式误差估计。
引用
@article{arxiv.1901.09731,
title = {Convergence of a Relaxed Variable Splitting Coarse Gradient Descent Method for Learning Sparse Weight Binarized Activation Neural Networks},
author = {Thu Dinh and Jack Xin},
journal= {arXiv preprint arXiv:1901.09731},
year = {2019}
}
备注
arXiv admin note: substantial text overlap with arXiv:1812.05719