轻度过参数化对浅层 ReLU 神经网络优化景观的影响
机器学习
2021-08-02 v2 机器学习
摘要
我们研究轻度过参数化对形式为 的简单 ReLU 神经网络的优化景观的影响,在一个被充分研究的师生设定中,其中目标值由相同架构生成,且直接针对高斯输入优化总体平方损失。我们证明,当教师与学生网络拥有相同数量的神经元时,目标函数在全局极小附近是强凸的,但在任何程度的过参数化之后,它甚至不是\emph{局部凸}的。此外,相关的理想性质(例如,一点强凸性与 Polyak-{\L}ojasiewicz 条件)即使局部也不成立。另一方面,我们确立目标函数在\emph{大多数}方向(恰当定义)上仍是一点强凸的,并在此性质下给出优化保证。对于非全局极小,我们证明即使仅添加一个神经元也会将非全局极小变为鞍点。这在某些经验验证的技术条件下成立。这些结果提供了一种可能的解释:为何当我们过参数化时,即使过参数化程度非常温和,恢复全局极小也会变得显著更容易。
引用
@article{arxiv.2006.01005,
title = {The Effects of Mild Over-parameterization on the Optimization Landscape of Shallow ReLU Neural Networks},
author = {Itay Safran and Gilad Yehudai and Ohad Shamir},
journal= {arXiv preprint arXiv:2006.01005},
year = {2021}
}