面向浮点量化的自适应优化器收敛性分析
机器学习
2026-03-03 v2 人工智能
机器学习
摘要
大语言模型(LLM)的快速扩张使得低精度训练成为减少内存、提高效率并支持更大模型和数据集的关键需求。然而,现有的自适应优化器收敛理论均假设所有组件均为精确值,忽略了硬件感知的量化问题,导致对低精度训练为何仍然有效的疑问仍未得到解答。我们提出了首个分析自适应优化器(包括 Adam 和 Muon)在梯度、权重及优化器状态(如动量估计)进行浮点量化情况下的收敛性的理论框架。在该框架下,我们在标准随机梯度假设下推导了 smooth non-convex 目标的收敛速率,明确刻画了来自不同组件的量化误差对收敛的影响。我们表明,只要 Mantissa 长度随迭代次数对数式增长,两种算法均可保持接近全精度版本的收敛速率。我们的分析进一步揭示,Adam 对权重和二阶矩量化极其敏感,这源于其 的依赖,而 Muon 则只需较弱的误差控制,因此可能更具鲁棒性。这些结果缩小了实证成功与理论理解低精度训练方法之间的差距。数值实验在合成数据和真实数据上都得到了我们理论的证实。
引用
@article{arxiv.2510.21314,
title = {A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization},
author = {Xuan Tang and Jichu Li and Difan Zou},
journal= {arXiv preprint arXiv:2510.21314},
year = {2026}
}
备注
68 pages, 13 figures, ICLR 2026