中文

动量方法的连续时间分析

机器学习 2021-06-01 v2 数值分析 数值分析 机器学习

摘要

基于梯度下降的优化方法是神经网络参数训练的基础,因此在众多应用中取得的令人瞩目的测试结果中,它们构成了一个重要组成部分。引入随机性是其在实际问题中取得成功的关键,并且人们对随机梯度下降在此背景下的作用已有一定理解。梯度下降的动量改进方法,如 Polyak 的重球方法(HB)和 Nesterov 的加速梯度方法(NAG),也被广泛采用。在这项工作中,我们专注于理解动量在神经网络训练中的作用,集中讨论算法每一步中动量贡献固定的常见情况。为简明地阐述思想,我们在确定性设定下进行研究。我们的方法是推导离散算法的连续时间近似;这些连续时间近似为离散算法内部的运行机制提供了洞见。我们证明了三个这样的近似。首先,我们证明固定动量方法的标准实现,在学习率收缩至零的渐近意义下,近似于一个时间重缩放的梯度下降流;这一结果在消失学习率的极限下,并未将动量方法与纯梯度下降区分开来。接着,我们证明两个结果,旨在理解所观察到的固定动量方法相对于梯度下降的实际优势。我们通过证明以小但固定的学习率作为参数的连续时间极限的近似来实现这一点。此外,在第三个结果中,我们证明动量方法存在一个指数吸引的不变流形,在该流形上,动力学近似地简化为关于一个修正损失函数的梯度流。

关键词

引用

@article{arxiv.1906.04285,
  title  = {Continuous Time Analysis of Momentum Methods},
  author = {Nikola B. Kovachki and Andrew M. Stuart},
  journal= {arXiv preprint arXiv:1906.04285},
  year   = {2021}
}

备注

40 pages, 7 figures