中文

懒惰训练机制下随机梯度朗之万动力学的收敛性

机器学习 2026-01-30 v3 最优化与控制

摘要

连续时间模型为深入理解深度学习中优化算法的训练动力学提供了重要视角。在本文中,我们针对随机梯度朗之万动力学(SGLD)——它是随机梯度下降在连续时间下的一个伊藤(Itô)随机微分方程(SDE)近似——在懒惰训练机制下建立了非渐近收敛性分析。我们证明,在损失函数 Hessian 满足正则性条件的前提下,具有乘性且状态相关噪声的 SGLD (i) 在整个训练过程中以高概率产生一个非退化核,(ii) 在期望意义上实现对经验风险最小化子的指数收敛,并给出了关于最优性间隙的有限时间和有限宽度界。我们通过回归设定中的数值算例对理论结果进行了验证。

关键词

引用

@article{arxiv.2510.21245,
  title  = {Convergence of Stochastic Gradient Langevin Dynamics in the Lazy Training Regime},
  author = {Noah Oberweis and Semih Cayci},
  journal= {arXiv preprint arXiv:2510.21245},
  year   = {2026}
}