中文

关于机器学习的非凸优化:梯度、随机性与鞍点

机器学习 2019-09-05 v2 最优化与控制 机器学习

摘要

梯度下降(GD)与随机梯度下降(SGD)是大规模机器学习的支柱。尽管经典理论侧重于分析这些方法在凸优化问题中的性能,但机器学习中最显著的成果涉及非凸优化,理论与实际之间出现了鸿沟。确实,对 GD 和 SGD 的传统分析表明两种算法都能高效收敛到驻点。但这些分析未考虑收敛到鞍点的可能性。近期的理论表明 GD 和 SGD 可避开鞍点,但这些分析中对维度的依赖是多项式级的。对于维度可达百万量级的现代机器学习,此种依赖将是灾难性的。我们分析 GD 和 SGD 的扰动版本,并表明它们是真正高效的——其对维度的依赖仅为多对数级。确实,这些算法在本质上与收敛到经典一阶驻点相同的时间内收敛到二阶驻点。

关键词

引用

@article{arxiv.1902.04811,
  title  = {On Nonconvex Optimization for Machine Learning: Gradients, Stochasticity, and Saddle Points},
  author = {Chi Jin and Praneeth Netrapalli and Rong Ge and Sham M. Kakade and Michael I. Jordan},
  journal= {arXiv preprint arXiv:1902.04811},
  year   = {2019}
}

备注

A preliminary version of this paper, with a subset of the results that are presented here, was presented at ICML 2017 (also as arXiv:1703.00887)