中文

小批量随机梯度最速下降法的隐式偏差

机器学习 2026-02-13 v1

摘要

许多广泛使用的优化方法,如SignSGD和Muon,可以被解释为在不同范数诱导几何下的最速下降法实例。在这项工作中,我们研究了小批量随机最速下降法在多类分类中的隐式偏差,刻画了批量大小、动量和方差缩减如何在一般的逐项和Schatten-pp范数下塑造极限最大间隔行为和收敛速度。我们表明,在没有动量的情况下,收敛仅在大批量时发生,产生依赖于批量的间隔差距,但具有全批量收敛速度。相比之下,动量通过批量-动量权衡实现了小批量收敛,尽管会减慢收敛速度。这种方法提供了完全显式的、与维度无关的速率,改进了先前的结果。此外,我们证明了方差缩减可以在任何批量大小下恢复精确的全批量隐式偏差,尽管收敛速度较慢。最后,我们进一步研究了无动量的单批量最速下降法,并通过一个具体的数据示例揭示了其收敛到一个根本不同的偏差,这揭示了纯随机更新的一个关键局限性。总的来说,我们的统一分析阐明了随机优化何时与全批量行为一致,并为更深入地探索随机梯度最速下降算法的训练行为铺平了道路。

关键词

引用

@article{arxiv.2602.11557,
  title  = {The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient},
  author = {Jichu Li and Xuan Tang and Difan Zou},
  journal= {arXiv preprint arXiv:2602.11557},
  year   = {2026}
}