梯度下降为实用规模可泛化深度神经网络找到全局极小值
机器学习
2020-06-18 v3 机器学习
神经与进化计算
最优化与控制
摘要
在本文中,我们从理论上证明,梯度下降能够为实践中常见的非线性深度神经网络的所有层找到非凸优化的全局极小值。与以往理论不同,本文发展的理论仅需要实际的过参数化程度。我们的理论仅要求可训练参数数量随训练样本数量线性增加。这使得深度神经网络的规模与实践一致,且比以往理论所要求的规模小几个数量级。此外,我们证明网络规模的线性增长是最优速率,且除对数因子外无法改进。进一步,具有可训练性保证的深度神经网络被证明能够很好地泛化到未见过的测试样本,且对自然数据集而非随机数据集有效。
引用
@article{arxiv.1908.02419,
title = {Gradient Descent Finds Global Minima for Generalizable Deep Neural Networks of Practical Sizes},
author = {Kenji Kawaguchi and Jiaoyang Huang},
journal= {arXiv preprint arXiv:1908.02419},
year = {2020}
}
备注
Accepted. All the results remain the same. Additional explanations were added