深度学习中所有不良局部极小值的消除
机器学习
2020-01-17 v2 神经与进化计算
最优化与控制
机器学习
摘要
在本文中,我们从理论上证明,在实用假设下,为每个输出单元添加一个特殊神经元可消除任意深度神经网络在多类分类、二分类以及具有任意损失函数的回归任务中的所有次优局部极小值。在带有这些附加神经元的任意深度神经网络的每个局部极小值处,原始神经网络(不含附加神经元)的参数集合保证是原始神经网络的全局极小值。附加神经元的影响被证明在每个局部极小值处自动消失。此外,我们通过一个附加定理和若干示例,对通过附加神经元消除次优局部极小值的一种失效模式给出了新的理论刻画。本文还引入了一种基于局部极小值的可扰动梯度基(PGB)必要条件的新型证明技术,该技术为局部极小值的消除提供了新见解,并适用于分析除局部极小值消除之外的各种目标函数模型与变换。
引用
@article{arxiv.1901.00279,
title = {Elimination of All Bad Local Minima in Deep Learning},
author = {Kenji Kawaguchi and Leslie Pack Kaelbling},
journal= {arXiv preprint arXiv:1901.00279},
year = {2020}
}
备注
Accepted to appear in AISTATS 2020