中文

深度二次网络中避免伪局部极小

机器学习 2020-07-21 v2 最优化与控制 机器学习

摘要

尽管神经网络在实践中取得成功,由于其高维、非凸且高度非线性的模型结构,对其损失景观的理论理解一直具有挑战性。本文中,我们刻画了具有二次激活函数神经网络的均方误差损失的训练景观。我们证明当神经元数量大于或等于输入维度且以训练样本范数作为回归量时,伪局部极小与鞍点的存在性,且这些点可以概率一轻易逃脱。我们证明具有二次激活的深度过参数化神经网络享有类似的良好景观性质。我们的理论结果独立于数据分布,并填补了双层二次神经网络理论的现有空白。最后,我们经实验证明了这些问题向全局最小值的收敛。

关键词

引用

@article{arxiv.2001.00098,
  title  = {Avoiding Spurious Local Minima in Deep Quadratic Networks},
  author = {Abbas Kazemipour and Brett W. Larsen and Shaul Druckmann},
  journal= {arXiv preprint arXiv:2001.00098},
  year   = {2020}
}

备注

36 pages; added deep network experiments, results for population loss