中文

随机学习率的效应:通过 stationary distribution 分析非凸优化中 SGD 的动力学

机器学习 2025-09-09 v2 机器学习

摘要

我们考虑了带随机学习率的随机梯度下降(SGD)变体,并揭示了其收敛性质。SGD 是机器学习中广泛使用的随机优化算法,尤其在深度学习中。大量研究揭示了 SGD 及其理论上有利变体的收敛性质。在这些方法中,使用更新参数的 stationary distribution 进行收敛分析可提供可推广的结果。然而,要获得 stationary distribution,参数的更新方向必须不会退化,这限制了适用 SGD 变体的范围。在本研究中,我们考虑一种新型的 SGD 变体——泊松 SGD,它具有退化的参数更新方向,并使用随机学习率。因此,我们证明了泊松 SGD 更新的参数分布在弱假设下收敛于 stationary distribution。基于此,我们进一步表明,泊松 SGD 在非凸优化问题中寻找全局最小值,也评估了使用该方法的 generalization error。作为证明技术,我们将泊松 SGD 的分布近似为 bouncy particle sampler(BPS)的分布,并使用分段确定性马尔可夫过程(PDMP)的理论进步推导其 stationary distribution。

关键词

引用

@article{arxiv.2406.16032,
  title  = {Effect of Random Learning Rate: Theoretical Analysis of SGD Dynamics in Non-Convex Optimization via Stationary Distribution},
  author = {Naoki Yoshida and Shogo Nakakita and Masaaki Imaizumi},
  journal= {arXiv preprint arXiv:2406.16032},
  year   = {2025}
}

备注

28 pages