深度线性神经网络训练中涅斯捷罗夫加速梯度法的收敛性分析
机器学习
2022-04-19 v1 最优化与控制
摘要
动量方法,包括重球法(HB)与涅斯捷罗夫加速梯度法(NAG),因其快速收敛性被广泛用于神经网络训练。然而,由于神经网络的优化景观是非凸的,其收敛性与加速效果缺乏理论保证。近来,一些工作在过参数化 regime(其中参数数量超过训练样本数量)下增进了对动量方法收敛性的理解。尽管如此,现有结果主要聚焦于两层神经网络,远不足以解释动量方法在深度神经网络训练中的显著成功。受此启发,我们研究了具有恒定学习率与动量参数的 NAG 在训练两类深度线性网络架构时的收敛性:深度全连接线性神经网络与深度线性 ResNet。基于过参数化 regime,我们首先分析了随机高斯初始化下深度全连接线性神经网络 NAG 训练轨迹所诱导的残差动力学。我们的结果表明,NAG 能以 的速率收敛到全局最小值,其中 为迭代次数, 为依赖于特征矩阵条件数的常数。与 GD 的 速率相比,NAG 相对 GD 实现了加速。据我们所知,这是首个关于 NAG 在深度神经网络训练中收敛到全局最小值的理论保证。此外,我们将分析推广至深度线性 ResNet 并得到了类似的收敛结果。
引用
@article{arxiv.2204.08306,
title = {A Convergence Analysis of Nesterov's Accelerated Gradient Method in Training Deep Linear Neural Networks},
author = {Xin Liu and Wei Tao and Zhisong Pan},
journal= {arXiv preprint arXiv:2204.08306},
year = {2022}
}
备注
34 pages