伪局部极小在两层ReLU神经网络中普遍存在
机器学习
2018-08-10 v3 机器学习
摘要
我们考虑训练形如 的简单ReLU神经网络的优化问题,损失函数为平方损失。我们给出一项计算机辅助证明:即便输入分布为标准高斯分布,即便维度任意大,即便目标值由具有正交参数向量的此类网络生成,一旦 ,该问题仍可能存在伪局部极小。由测度集中论证可知,在高输入维度下,相关规模的\emph{几乎所有}目标网络都会导致伪局部极小。此外,我们开展的实验表明,命中此类局部极小的概率相当高,且随网络规模增大而升高。从积极一面看,轻度过参数化似乎能大幅减少此类局部极小,表明在此设定下获得正面结果需要过参数化假设。
引用
@article{arxiv.1712.08968,
title = {Spurious Local Minima are Common in Two-Layer ReLU Neural Networks},
author = {Itay Safran and Ohad Shamir},
journal= {arXiv preprint arXiv:1712.08968},
year = {2018}
}