关于深度学习中的ADMM:收敛性与避免饱和
摘要
本文针对具有 sigmoid 型激活函数的深度神经网络训练,发展了一种交替方向乘子法(ADMM)(称为 sigmoid-ADMM 对),主要动机在于 ADMM 的无梯度特性可避免 sigmoid 型激活的饱和,以及具有 sigmoid 型激活的深度神经网络(称为深度 sigmoid 网络)相较于其修正线性单元(ReLU)对应网络(称为深度 ReLU 网络)在逼近方面的优势。特别地,我们通过证明 ReLU 激活函数可被具有两个隐藏层和有限多个自由参数的深度 sigmoid 网络很好地逼近,反之则不然,从而证明深度 sigmoid 网络的逼近能力不弱于深度 ReLU 网络。我们还建立了所提 ADMM 对于深度 sigmoid 网络训练的非线性约束公式的全局收敛性,从任意初始点收敛到 Karush-Kuhn-Tucker (KKT) 点,收敛速率为 。除 sigmoid 激活外,该收敛定理对一类一般的平滑激活函数也成立。与广泛使用的用于深度 ReLU 网络训练的随机梯度下降(SGD)算法(称为 ReLU-SGD 对)相比,所提 sigmoid-ADMM 对在算法超参数(包括学习率、初始化方案以及输入数据的预处理)方面实际上具有稳定性。此外,我们发现,对于逼近和学习简单但重要的函数,所提 sigmoid-ADMM 对在数值上优于 ReLU-SGD 对。
引用
@article{arxiv.1902.02060,
title = {On ADMM in Deep Learning: Convergence and Saturation-Avoidance},
author = {Jinshan Zeng and Shao-Bo Lin and Yuan Yao and Ding-Xuan Zhou},
journal= {arXiv preprint arXiv:1902.02060},
year = {2021}
}
备注
This is a revised version of our previous one entitled "A Convergence Analysis of Nonlinearly Constrained ADMM in Deep Learning, arXiv:1902.02060" with some significantly changes