中文

通过原始平均的动量法:非凸优化的理论洞察与学习率调度

机器学习 2021-06-02 v4 最优化与控制 机器学习

摘要

动量方法如今在机器学习界被广泛用于训练深度神经网络等非凸模型。经验上,它们优于传统的随机梯度下降(SGD)方法。本文利用一种称为随机原始平均(SPA)形式的等价重写,对带动量的 SGD(SGD+M)进行了 Lyapunov 分析。该分析在非凸情形下比以往理论紧得多,由此我们能够精确洞察 SGD+M 何时可能优于 SGD,以及哪些超参数调度会奏效及其原因。

关键词

引用

@article{arxiv.2010.00406,
  title  = {Momentum via Primal Averaging: Theoretical Insights and Learning Rate Schedules for Non-Convex Optimization},
  author = {Aaron Defazio},
  journal= {arXiv preprint arXiv:2010.00406},
  year   = {2021}
}