中文

深度神经网络在局部Lojasiewicz条件下的随机梯度下降收敛性

机器学习 2024-01-17 v2 最优化与控制 机器学习

摘要

我们研究了随机梯度下降(SGD)对非凸目标函数的收敛性。在Chatterjee于\cite{chatterjee2022convergence}引入的局部Łojasiewicz条件以及损失函数景观的附加局部结构假设下,我们建立了正概率的局部收敛。我们证明的一个关键组成部分是确保SGD的整个轨迹以正概率停留在局部区域内。我们还给出了满足上述假设的有限宽度神经网络实例。

关键词

引用

@article{arxiv.2304.09221,
  title  = {Convergence of stochastic gradient descent under a local Lojasiewicz condition for deep neural networks},
  author = {Jing An and Jianfeng Lu},
  journal= {arXiv preprint arXiv:2304.09221},
  year   = {2024}
}

备注

v2 fixed several mistakes. Some parts have been rewritten