深度与宽度神经网络的损失曲面
机器学习
2017-06-14 v2 人工智能
计算机视觉与模式识别
神经与进化计算
机器学习
摘要
尽管深度神经网络背后的优化问题高度非凸,但在实践中经常观察到训练深度网络似乎不会陷入次优点。有人认为这是因为所有局部极小值都接近于全局最优。我们证明这(几乎)是正确的,事实上,对于一个具有平方损失和解析激活函数的全连接网络,只要该网络某一层的隐藏单元数量大于训练点数量,并且从该层开始的网络结构为金字塔形,则几乎所有局部极小值都是全局最优的。
引用
@article{arxiv.1704.08045,
title = {The loss surface of deep and wide neural networks},
author = {Quynh Nguyen and Matthias Hein},
journal= {arXiv preprint arXiv:1704.08045},
year = {2017}
}
备注
ICML 2017. Main results now hold for larger classes of loss functions