中文

低精度训练中随机梯度下降为何会减慢?

机器学习 2026-01-09 v4 人工智能 信息论 数值分析 math.IT 数值分析

摘要

低精度训练已成为减少大规模深度学习计算和内存成本的关键技术。然而,对梯度进行量化会引入幅度缩小,可能改变随机梯度下降(SGD)的收敛方式。本研究探讨了在梯度缩小模型下的 SGD 收敛,其中每个随机梯度均按因子 qk(0,1]q_k \in (0,1] 进行缩放。我们证明,这种缩小会影响步长 μk\mu_k,导致有效步长为 μkqk\mu_k q_k,当 qmin<1q_{\min} < 1 时会减慢收敛速度。在典型的光滑性和有界方差假设下,我们证明低精度 SGD 仍然收敛,但收敛速度受 qminq_{\min} 控制,且由于量化效应,其稳态误差水平更高。我们在标准 SGD 收敛框架内将其视为梯度缩小,理论分析了较低数值精度如何减慢训练过程。

关键词

引用

@article{arxiv.2508.07142,
  title  = {Why Does Stochastic Gradient Descent Slow Down in Low-Precision Training?},
  author = {Vincent-Daniel Yun},
  journal= {arXiv preprint arXiv:2508.07142},
  year   = {2026}
}