深度神经网络在局部Lojasiewicz条件下的随机梯度下降收敛性
机器学习
2024-01-17 v2 最优化与控制
机器学习
摘要
我们研究了随机梯度下降(SGD)对非凸目标函数的收敛性。在Chatterjee于\cite{chatterjee2022convergence}引入的局部Łojasiewicz条件以及损失函数景观的附加局部结构假设下,我们建立了正概率的局部收敛。我们证明的一个关键组成部分是确保SGD的整个轨迹以正概率停留在局部区域内。我们还给出了满足上述假设的有限宽度神经网络实例。
引用
@article{arxiv.2304.09221,
title = {Convergence of stochastic gradient descent under a local Lojasiewicz condition for deep neural networks},
author = {Jing An and Jianfeng Lu},
journal= {arXiv preprint arXiv:2304.09221},
year = {2024}
}
备注
v2 fixed several mistakes. Some parts have been rewritten