浅层神经网络随机梯度下降全局收敛的改进过参数化界
机器学习
2022-11-17 v2 最优化与控制
摘要
我们研究了一类单隐藏层前馈神经网络在随机梯度下降算法全局收敛所需的过参数化界,考虑了实践中使用的大多数激活函数,包括 ReLU。我们在所需隐藏层宽度方面改进了现有的最优结果。我们引入了一种结合非线性分析与网络随机初始化性质的新证明技术。首先,我们建立了作为 MSE 损失的梯度流的非光滑类比的微分包含连续解的全局收敛性。其次,我们提供了一个技术结果(也适用于一般逼近器),将前述微分包含的解与(离散)随机梯度下降序列联系起来,从而确立了随机梯度下降迭代以线性收敛趋于零损失。
引用
@article{arxiv.2201.12052,
title = {Improved Overparametrization Bounds for Global Convergence of Stochastic Gradient Descent for Shallow Neural Networks},
author = {Bartłomiej Polaczyk and Jacek Cyranka},
journal= {arXiv preprint arXiv:2201.12052},
year = {2022}
}