中文

改进一般随机梯度下降渐近知识的新非凸框架

最优化与控制 2023-07-17 v1

摘要

随机梯度优化方法被广泛用于最小化非凸光滑目标函数,例如在训练深度神经网络时。然而,关于这些方法渐近行为的理论保证仍然很少。特别是,确保迭代序列几乎必然收敛到平稳点相当具有挑战性。在本工作中,我们引入了一个新的 Kurdyka-Lojasiewicz 理论框架,用于分析最小化非凸光滑目标时随机梯度下降(SGD)格式的渐近行为。特别地,我们的框架针对由满足温和条件下降条件的任意 SGD 方法生成的迭代序列,提供了新的几乎必然收敛结果。我们通过若干模拟示例对所提出的框架进行了说明。我们阐明了所考虑理论假设的作用,并研究了在这些假设被完全或部分满足时 SGD 迭代序列受到的影响。

关键词

引用

@article{arxiv.2307.06987,
  title  = {A new non-convex framework to improve asymptotical knowledge on generic stochastic gradient descent},
  author = {Jean-Baptiste Fest and Audrey Repetti and Emilie Chouzenoux},
  journal= {arXiv preprint arXiv:2307.06987},
  year   = {2023}
}