中文

梯度下降找到深度神经网络的全局极小值

机器学习 2019-05-30 v4 人工智能 计算机视觉与模式识别 最优化与控制 机器学习

摘要

尽管目标函数非凸,梯度下降在训练深度神经网络时仍能找到全局极小值。本文证明,对于带有残差连接(ResNet)的深度过参数化神经网络,梯度下降在多项式时间内实现零训练损失。我们的分析依赖于神经网络架构所诱导的格拉姆矩阵的特定结构。该结构使我们能够表明格拉姆矩阵在整个训练过程中是稳定的,而这种稳定性意味着梯度下降算法的全局最优性。我们进一步将分析推广到深度残差卷积神经网络并获得了类似的收敛结果。

关键词

引用

@article{arxiv.1811.03804,
  title  = {Gradient Descent Finds Global Minima of Deep Neural Networks},
  author = {Simon S. Du and Jason D. Lee and Haochuan Li and Liwei Wang and Xiyu Zhai},
  journal= {arXiv preprint arXiv:1811.03804},
  year   = {2019}
}

备注

ICML 2019