中文

数据洗牌、步长拉伸:常数步长 SGD 中的更精确偏差分析

最优化与控制 2026-04-14 v1 机器学习

摘要

许多机器学习任务可转化为有限和 min-max 优化或更一般的variational 不等式问题(VIPs)。鉴于其简单性和可扩展性,带常数步长的随机梯度方法被广泛使用,尽管它们仅收敛于常数项。近期引起注意的两项经典技术旨在缓解此问题:数据随机重洗牌和跨迭代的Richardson- Romberg 外推。随机重洗牌锐化估计解的均方误差(MSE),而Richardson- Romberg 外推正交作用,提供其偏差的二阶降低。在本文中,我们展示其组合严格优于两者,不仅保持增强的MSE保证,还产生更大的三次偏差细化。鉴于我们不了解结构化非单调 VIPs 中此类协同效应的理论保证,本文作出首次贡献。我们的分析分为两个步骤:(i) 我们平滑由重洗牌引起的离散噪声,并利用连续状态马尔可夫链理论工具,建立一种新的大数律和中心极限定理用于其迭代;(ii) 我们采用谱张量技术,证明即便在由重洗牌引起的偏置梯度 oracle 作用下,外推仍能消除偏差并锐化渐近行为。最终,大量实验验证了我们的理论,始终显示出实践中显著的加速。

关键词

引用

@article{arxiv.2604.10373,
  title  = {Shuffling the Data, Stretching the Step-size: Sharper Bias in constant step-size SGD},
  author = {Konstantinos Emmanouilidis and Emmanouil-Vasileios Vlatakis-Gkaragkounis and Rene Vidal},
  journal= {arXiv preprint arXiv:2604.10373},
  year   = {2026}
}

备注

Accepted in ICLR 2026 Conference