中文

随机梯度下降的全局收敛性与稳定性

机器学习 2022-10-11 v3 最优化与控制

摘要

在机器学习中,随机梯度下降(SGD)被广泛用于通过高度非凸目标函数以及同样复杂的噪声模型来训练模型。遗憾的是,SGD 理论常常做出限制性假设,既无法刻画真实问题的非凸性,也几乎完全忽略了实践中存在的复杂噪声模型。在这项工作中,我们针对这一不足取得了实质性进展。首先,我们证明在近乎任意的非凸性和噪声模型下,SGD 的迭代序列要么全局收敛到驻点,要么发散。在对非凸性与噪声模型的联合行为做出比现有文献中假设稍具限制性的假设(该假设推广了当前文献中的假设)后,我们证明即使迭代序列发散,目标函数也不会发散。作为我们结果的推论,SGD 可被应用于更大范围的随机优化问题,并能够对其全局收敛行为与稳定性抱有信心。

关键词

引用

@article{arxiv.2110.01663,
  title  = {Global Convergence and Stability of Stochastic Gradient Descent},
  author = {Vivak Patel and Shushu Zhang and Bowen Tian},
  journal= {arXiv preprint arXiv:2110.01663},
  year   = {2022}
}