通过马尔可夫链探讨定步长SGD的收敛与集中性质
机器学习
2025-11-25 v3 机器学习
最优化与控制
摘要
我们考虑使用定步长随机梯度下降(SGD)优化平滑且强凸的目标函数,并通过马尔可夫链的视角研究其性质。我们证明,对于具有轻度受控方差的无偏梯度估计,迭代在总变差距离上收敛于不变分布。与先前的工作相比,我们在梯度噪声分布的松弛假设下,也建立了在 Wasserstein-2 距离上的这种收敛。我们的分析表明,当这些性质对梯度成立时,SGD 迭代及其不变极限分布会继承次高斯或次指数集中性质。这允许为最终估计推导出高置信度界限。最后,在线性情况下的此类条件下,我们获得了尾序列的 Polyak-Ruppert 平均的无维数偏差界限。我们所有的结果都是非渐近的,并通过几个应用讨论了其推论。
引用
@article{arxiv.2306.11497,
title = {Convergence and concentration properties of constant step-size SGD through Markov chains},
author = {Ibrahim Merad and Stéphane Gaïffas},
journal= {arXiv preprint arXiv:2306.11497},
year = {2025}
}