低精度训练中随机梯度下降为何会减慢?
机器学习
2026-01-09 v4 人工智能
信息论
数值分析
math.IT
数值分析
摘要
低精度训练已成为减少大规模深度学习计算和内存成本的关键技术。然而,对梯度进行量化会引入幅度缩小,可能改变随机梯度下降(SGD)的收敛方式。本研究探讨了在梯度缩小模型下的 SGD 收敛,其中每个随机梯度均按因子 进行缩放。我们证明,这种缩小会影响步长 ,导致有效步长为 ,当 时会减慢收敛速度。在典型的光滑性和有界方差假设下,我们证明低精度 SGD 仍然收敛,但收敛速度受 控制,且由于量化效应,其稳态误差水平更高。我们在标准 SGD 收敛框架内将其视为梯度缩小,理论分析了较低数值精度如何减慢训练过程。
引用
@article{arxiv.2508.07142,
title = {Why Does Stochastic Gradient Descent Slow Down in Low-Precision Training?},
author = {Vincent-Daniel Yun},
journal= {arXiv preprint arXiv:2508.07142},
year = {2026}
}