中文

记忆在随机优化中的作用

机器学习 2020-03-13 v2 最优化与控制 机器学习

摘要

关于如何保留过去梯度的信息这一选择,极大地影响了 Heavy-ball、Nesterov 动量、RMSprop 和 Adam 等最先进随机优化方法的收敛性质。基于该观察,我们利用随机微分方程(SDEs)显式研究基于梯度的算法中记忆的作用。我们首先推导出一个通用的连续时间模型,该模型在确定性及随机性设定下均可纳入任意类型的记忆。我们针对弱拟凸与二次增长函数给出了该 SDE 的收敛保证。随后我们展示如何对该 SDE 进行离散化,得到一个灵活的离散时间算法,可实现从短期到长期范围的广谱记忆。该算法不仅为实践者增加了算法选择的自由度,而且在凸随机设定下相比经典动量具有更好的稳定性。特别地,其收敛无需迭代平均。有趣的是,我们的分析还将 Nesterov 动量新颖地解释为稳定梯度放大,并揭示了其在(凸)随机设定中不稳定行为的一种可能原因。此外,我们讨论了在 Adam 和 RMSprop 等自适应方法中利用长期记忆进行二阶矩估计。最后,我们提供了关于不同类型记忆在凸与非凸设定中影响的广泛实验研究。

关键词

引用

@article{arxiv.1907.01678,
  title  = {The Role of Memory in Stochastic Optimization},
  author = {Antonio Orvieto and Jonas Kohler and Aurelien Lucchi},
  journal= {arXiv preprint arXiv:1907.01678},
  year   = {2020}
}

备注

Accepted paper at the 35th Conference on Uncertainty in Artificial Intelligence (UAI), Tel Aviv, 2019