理解非凸随机优化中动量与时延加速的权衡
机器学习
2021-01-14 v6 机器学习
摘要
异步动量随机梯度下降算法(Async-MSGD)是分布式机器学习中最流行的算法之一。然而,由于当前技术限制,这些复杂非凸问题的收敛性质仍很大程度上未知。因此,在本文中,我们提议通过一个更简单但非平凡的非凸问题——流式 PCA 来分析该算法,这有助于我们更好地理解 Aync-MSGD,即便对更一般的问题也是如此。具体而言,我们通过扩散近似建立了 Async-MSGD 在流式 PCA 上的渐近收敛速率。我们的结果指出了异步与动量之间的基本权衡:为确保通过异步实现收敛与加速,我们必须减小动量(相较于 Sync-MSGD)。据我们所知,这是理解分布式非凸随机优化中 Async-MSGD 的首次理论尝试。我们提供了流式 PCA 和深度神经网络训练上的数值实验以支持我们对 Async-MSGD 的发现。
引用
@article{arxiv.1806.01660,
title = {Towards Understanding Acceleration Tradeoff between Momentum and Asynchrony in Nonconvex Stochastic Optimization},
author = {Tianyi Liu and Shiyang Li and Jianping Shi and Enlu Zhou and Tuo Zhao},
journal= {arXiv preprint arXiv:1806.01660},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:1802.05155