中文

深度线性神经网络训练中涅斯捷罗夫加速梯度法的收敛性分析

机器学习 2022-04-19 v1 最优化与控制

摘要

动量方法,包括重球法(HB)与涅斯捷罗夫加速梯度法(NAG),因其快速收敛性被广泛用于神经网络训练。然而,由于神经网络的优化景观是非凸的,其收敛性与加速效果缺乏理论保证。近来,一些工作在过参数化 regime(其中参数数量超过训练样本数量)下增进了对动量方法收敛性的理解。尽管如此,现有结果主要聚焦于两层神经网络,远不足以解释动量方法在深度神经网络训练中的显著成功。受此启发,我们研究了具有恒定学习率与动量参数的 NAG 在训练两类深度线性网络架构时的收敛性:深度全连接线性神经网络与深度线性 ResNet。基于过参数化 regime,我们首先分析了随机高斯初始化下深度全连接线性神经网络 NAG 训练轨迹所诱导的残差动力学。我们的结果表明,NAG 能以 (1O(1/κ))t(1 - \mathcal{O}(1/\sqrt{\kappa}))^t 的速率收敛到全局最小值,其中 tt 为迭代次数,κ>1\kappa > 1 为依赖于特征矩阵条件数的常数。与 GD 的 (1O(1/κ))t(1 - \mathcal{O}(1/{\kappa}))^t 速率相比,NAG 相对 GD 实现了加速。据我们所知,这是首个关于 NAG 在深度神经网络训练中收敛到全局最小值的理论保证。此外,我们将分析推广至深度线性 ResNet 并得到了类似的收敛结果。

关键词

引用

@article{arxiv.2204.08306,
  title  = {A Convergence Analysis of Nesterov's Accelerated Gradient Method in Training Deep Linear Neural Networks},
  author = {Xin Liu and Wei Tao and Zhisong Pan},
  journal= {arXiv preprint arXiv:2204.08306},
  year   = {2022}
}

备注

34 pages