过参数化非线性系统与神经网络中的损失景观与优化
机器学习
2021-05-28 v2 最优化与控制
机器学习
摘要
深度学习的成功在很大程度上归功于应用于大型神经网络的基于梯度的优化方法的显著有效性。本工作的目的是为过参数化机器学习模型与非线性方程组系统中的损失景观与高效优化提出一种现代视角和通用数学框架,该设定包含过参数化深度神经网络。我们的出发观察是,对应于此类系统的优化问题通常即便在局部也不凸。我们论证它们反而在大部分(而非全部)参数空间上满足 PL,即 Polyak-Lojasiewicz 条件的一种变体,这保证了(随机)梯度下降(SGD/GD)解的存在性与高效优化。这些系统的 PL 条件与非线性系统相关联的切核的条件数密切相关,展示了基于 PL 的非线性理论如何平行于对过参数化线性方程的经典分析。我们证明宽神经网络满足 PL 条件,这解释了(S)GD 收敛到全局极小值。最后我们提出一种适用于“近似”过参数化系统的 PL 条件的松弛形式。
引用
@article{arxiv.2003.00307,
title = {Loss landscapes and optimization in over-parameterized non-linear systems and neural networks},
author = {Chaoyue Liu and Libin Zhu and Mikhail Belkin},
journal= {arXiv preprint arXiv:2003.00307},
year = {2021}
}
备注
The discussion on transition to linearity in Version 1 has been moved to arXiv:2010.01092 (appeared in NeurIPS 2020)