基于多凸交替优化的无梯度加速神经网络训练
最优化与控制
2022-02-17 v4
摘要
近年来,尽管随机梯度下降(SGD)及其变体因训练神经网络而广为人知,但其存在缺乏理论保证、梯度消失以及对输入过度敏感等局限。为克服这些缺陷,交替最小化方法近来吸引了快速增长的关注。然而,作为一个新兴且开放的领域,若干新挑战尚待解决,包括 1)收敛性质对惩罚参数敏感,以及 2)理论收敛速率缓慢。为此,我们提出一种新颖的单调深度学习交替最小化(mDLAM)算法以应对这两大挑战。我们创新性的不等式约束公式以非凸等式约束无限逼近原问题,使得所提 mDLAM 算法的收敛性证明不受超参数选择影响。我们的 mDLAM 算法通过 Nesterov 加速技术实现了快速的线性收敛。在多个基准数据集上的大量实验证明了所提 mDLAM 算法的收敛性、有效性与高效性。我们的代码见 \url{https://github.com/xianggebenben/mDLAM}。
引用
@article{arxiv.1811.04187,
title = {Accelerated Gradient-free Neural Network Training by Multi-convex Alternating Optimization},
author = {Junxiang Wang and Hongyi Li and Liang Zhao},
journal= {arXiv preprint arXiv:1811.04187},
year = {2022}
}
备注
Accepted by Neurocomputing