无坏局部极小值的深度学习
机器学习
2016-12-30 v3 机器学习
最优化与控制
摘要
在本文中,我们证明了1989年发表的一个猜想,并部分解决了一个在2015年学习理论会议(COLT)上宣布的开放问题。在没有任何不现实假设下,我们首先证明深度线性神经网络(任意深度和任意宽度)的平方损失函数的以下陈述:1)函数非凸非凹,2)每个局部极小都是全局极小,3)每个不是全局极小的临界点都是鞍点,4)对于更深网络(多于三层)存在“坏”鞍点(其中Hessian没有负特征值),而对于浅层网络(三层)没有坏鞍点。此外,对于深度非线性神经网络,我们在采用自近期工作的独立性假设下通过归约到深度线性模型证明了相同的四个陈述。结果,我们给出一个实例,可回答以下问题:理论上直接训练深度模型有多难?它比经典机器学习模型更难(因为非凸性),但不太难(因为不存在坏的局部极小)。此外,数学证明的更深模型坏鞍点的存在将暗示一个可能的开放问题。我们注意到即使我们推进了深度学习和非凸优化的理论基础,理论与实践之间仍有差距。
引用
@article{arxiv.1605.07110,
title = {Deep Learning without Poor Local Minima},
author = {Kenji Kawaguchi},
journal= {arXiv preprint arXiv:1605.07110},
year = {2016}
}
备注
In NIPS 2016. Selected for NIPS oral presentation (top 2% submissions). ---- The final NIPS 2016 version: the results remain the same