中文

通过星凸路径 SGD 在深度学习中收敛至全局最小值

机器学习 2019-01-03 v1 机器学习

摘要

随机梯度下降(SGD)在训练多种深度神经网络时表现出惊人的有效性。然而,对于 SGD 如何以及为何能将这些复杂网络训练至全局最小值,目前仍缺乏理解。在本研究中,我们针对神经网络训练中常见的非凸优化问题,确立了 SGD 收敛至全局最小值的结论。我们的论证利用了以下两个重要性质:1)训练损失可以达到(近似)零值,这在深度学习中已被广泛观察到;2)SGD 遵循星凸路径,本文通过各种实验对此进行了验证。在此背景下,我们的分析表明,尽管 SGD 长期以来被视为一种随机算法,但它以本质上确定性的方式收敛至全局最小值。

关键词

引用

@article{arxiv.1901.00451,
  title  = {SGD Converges to Global Minimum in Deep Learning via Star-convex Path},
  author = {Yi Zhou and Junjie Yang and Huishuai Zhang and Yingbin Liang and Vahid Tarokh},
  journal= {arXiv preprint arXiv:1901.00451},
  year   = {2019}
}

备注

ICLR2019