凸与非凸优化中随机动量方法的统一收敛性分析
最优化与控制
2016-05-06 v2 机器学习
摘要
近年来,随机动量(stochastic momentum)方法在深度神经网络训练中被广泛采用。然而,其收敛性分析目前仍探索不足,尤其对于非凸优化。本文通过发展两种随机动量方法(即随机重球法(stochastic heavy-ball method)和 Nesterov 加速梯度法的随机变体)的基本收敛性分析,填补了实践与理论之间的鸿沟。我们希望本文得出的基本收敛结果可作为随机动量方法收敛性的参考,并作为未来随机动量方法发展中进行比较的基线。本文收敛性分析的新颖之处在于一个统一框架,它揭示了不同随机动量方法与随机梯度法之间异同的更多见解。该统一框架展现出由一自由参数引起的从梯度法到 Nesterov 加速梯度法、最终到重球法的连续变化,这有助于解释深度学习中测试误差收敛行为所观察到的类似变化。此外,我们优化深度神经网络的实证结果表明,在三种随机方法中,Nesterov 加速梯度法的随机变体在训练误差收敛速度与测试误差收敛鲁棒性之间取得了良好权衡。
引用
@article{arxiv.1604.03257,
title = {Unified Convergence Analysis of Stochastic Momentum Methods for Convex and Non-convex Optimization},
author = {Tianbao Yang and Qihang Lin and Zhe Li},
journal= {arXiv preprint arXiv:1604.03257},
year = {2016}
}
备注
Added some references and more empirical results