过参数化神经网络的Nesterov加速梯度方法的可证明收敛性
机器学习
2022-04-19 v3 人工智能
摘要
动量方法,如重球法(HB)与Nesterov加速梯度法(NAG),通过将梯度历史纳入当前更新过程,已广泛用于神经网络训练。实践中,它们常提供优于(随机)梯度下降(GD)且收敛更快的性能。尽管有这些经验成功,对其加速收敛率的理论理解仍然缺乏。近来,一些尝试通过分析过参数化机制下基于梯度方法的轨迹来弥补,其中参数数量显著大于训练样本数。然而,现有理论工作大多关注GD,且已建立的NAG收敛结果劣于HB与GD,无法解释NAG的实际成功。本文中,我们通过分析随机初始化的过参数化两层全连接ReLU神经网络训练中的NAG,向弥补此差距迈出一步。尽管目标函数非凸且非光滑,我们证明NAG以非渐近线性率 收敛到全局极小,其中 为Gram矩阵的条件数, 为迭代次数。与GD的收敛率 相比,我们的结果为NAG在神经网络训练中的加速提供了理论保证。此外,我们的发现表明NAG与HB具有相似的收敛率。最后,我们在六个基准数据集上进行大量实验以验证理论结果的正确性。
引用
@article{arxiv.2107.01832,
title = {Provable Convergence of Nesterov's Accelerated Gradient Method for Over-Parameterized Neural Networks},
author = {Xin Liu and Zhisong Pan and Wei Tao},
journal= {arXiv preprint arXiv:2107.01832},
year = {2022}
}