激活函数中的微小非线性会在神经网络中制造糟糕的局部极小
机器学习
2019-05-29 v4 最优化与控制
机器学习
摘要
我们研究神经网络的损失曲面。我们证明,即便对于具有“极微弱”非线性的单隐藏层网络,经验风险在多数情况下也存在伪局部极小。因此我们的结果表明,一般而言“无伪局部极小”仅是深度线性网络的性质,从线性网络获得的见解可能并不稳健。具体地,对 ReLU(类)网络我们构造性地证明,对几乎所有实际数据集都存在无穷多个局部极小。我们还给出一个针对更一般激活函数(sigmoid、tanh、arctan、ReLU 等)的反例,其存在糟糕的局部极小。相对于已有关于神经网络伪局部最优的结果,我们的结果做了最宽松的假设。我们通过给出深度线性网络全局最优性的全面刻画来完成讨论,该刻画统一了关于此主题的其他结果。
引用
@article{arxiv.1802.03487,
title = {Small nonlinearities in activation functions create bad local minima in neural networks},
author = {Chulhee Yun and Suvrit Sra and Ali Jadbabaie},
journal= {arXiv preprint arXiv:1802.03487},
year = {2019}
}
备注
33 pages, appeared at ICLR 2019