中文

伪局部极小在两层ReLU神经网络中普遍存在

机器学习 2018-08-10 v3 机器学习

摘要

我们考虑训练形如 xi=1kmax{0,wix}\mathbf{x}\mapsto \sum_{i=1}^{k}\max\{0,\mathbf{w}_i^\top \mathbf{x}\} 的简单ReLU神经网络的优化问题,损失函数为平方损失。我们给出一项计算机辅助证明:即便输入分布为标准高斯分布,即便维度任意大,即便目标值由具有正交参数向量的此类网络生成,一旦 6k206\le k\le 20,该问题仍可能存在伪局部极小。由测度集中论证可知,在高输入维度下,相关规模的\emph{几乎所有}目标网络都会导致伪局部极小。此外,我们开展的实验表明,命中此类局部极小的概率相当高,且随网络规模增大而升高。从积极一面看,轻度过参数化似乎能大幅减少此类局部极小,表明在此设定下获得正面结果需要过参数化假设。

关键词

引用

@article{arxiv.1712.08968,
  title  = {Spurious Local Minima are Common in Two-Layer ReLU Neural Networks},
  author = {Itay Safran and Ohad Shamir},
  journal= {arXiv preprint arXiv:1712.08968},
  year   = {2018}
}