中文

非凸过参数化学习中 SGD 的指数收敛性

最优化与控制 2018-11-08 v1 机器学习 机器学习

摘要

通过随机梯度下降(SGD)方法学习的大型过参数化模型已成为现代机器学习的关键要素。尽管 SGD 方法在实践中非常有效,大多数 SGD 的理论分析表明其收敛速度慢于经验观察。在我们最近的工作 [8] 中,我们分析了现代过参数化学习中常见的插值如何导致凸损失函数下具有恒定步长的 SGD 指数收敛。在本注记中,我们将这些结果扩展到满足 Polyak-Lojasiewicz(PL)条件的更广泛非凸函数类。机器学习中许多重要的非凸问题,包括一些类的神经网络,最近已被证明满足 PL 条件。我们认为 PL 条件为许多机器学习问题,特别是在过参数化机制中,提供了一个相关且有吸引力的设定。

关键词

引用

@article{arxiv.1811.02564,
  title  = {On exponential convergence of SGD in non-convex over-parametrized learning},
  author = {Raef Bassily and Mikhail Belkin and Siyuan Ma},
  journal= {arXiv preprint arXiv:1811.02564},
  year   = {2018}
}