中文

轻度过参数化对浅层 ReLU 神经网络优化景观的影响

机器学习 2021-08-02 v2 机器学习

摘要

我们研究轻度过参数化对形式为 xi=1kmax{0,wix}\mathbf{x}\mapsto\sum_{i=1}^k\max\{0,\mathbf{w}_i^{\top}\mathbf{x}\} 的简单 ReLU 神经网络的优化景观的影响,在一个被充分研究的师生设定中,其中目标值由相同架构生成,且直接针对高斯输入优化总体平方损失。我们证明,当教师与学生网络拥有相同数量的神经元时,目标函数在全局极小附近是强凸的,但在任何程度的过参数化之后,它甚至不是\emph{局部凸}的。此外,相关的理想性质(例如,一点强凸性与 Polyak-{\L}ojasiewicz 条件)即使局部也不成立。另一方面,我们确立目标函数在\emph{大多数}方向(恰当定义)上仍是一点强凸的,并在此性质下给出优化保证。对于非全局极小,我们证明即使仅添加一个神经元也会将非全局极小变为鞍点。这在某些经验验证的技术条件下成立。这些结果提供了一种可能的解释:为何当我们过参数化时,即使过参数化程度非常温和,恢复全局极小也会变得显著更容易。

关键词

引用

@article{arxiv.2006.01005,
  title  = {The Effects of Mild Over-parameterization on the Optimization Landscape of Shallow ReLU Neural Networks},
  author = {Itay Safran and Gilad Yehudai and Ohad Shamir},
  journal= {arXiv preprint arXiv:2006.01005},
  year   = {2021}
}