轻度过参数化两层神经网络的局部收敛理论
机器学习
2021-07-06 v2 机器学习
摘要
尽管过参数化被广泛认为对神经网络优化成功至关重要,现有大多数过参数化理论并未充分解释原因——它们要么在神经元移动很小的神经切线核 regime 下成立,要么需要海量神经元。在实践中,当数据由教师神经网络生成时,即便轻度过参数化的神经网络也能达到0损失并恢复教师神经元的方向。本文我们为轻度过参数化两层神经网络建立了局部收敛理论。我们表明,只要损失已低于某一阈值(相关参数的多项式),过度参数化两层神经网络中的所有学生神经元将收敛至某一教师神经元,且损失将趋于0。我们的结果对任意数量的学生神经元均成立,只要其至少不少于教师神经元数量,且我们的收敛速率与 student 神经元数量无关。我们分析的一个关键组成部分是对局部优化景观的新刻画——我们表明梯度满足 Lojasiewicz 性质的一个特例,这不同于先前工作使用的局部强凸性或 PL 条件。
引用
@article{arxiv.2102.02410,
title = {A Local Convergence Theory for Mildly Over-Parameterized Two-Layer Neural Network},
author = {Mo Zhou and Rong Ge and Chi Jin},
journal= {arXiv preprint arXiv:2102.02410},
year = {2021}
}
备注
Added references and fixed typos. Accepted to COLT 2021