ECO:无全精度主权重的量化训练
计算与语言
2026-01-30 v1 人工智能
机器学习
摘要
量化显著提高了大型语言模型(LLM)训练的计算和内存效率。然而,现有方法仍依赖于以高精度累积更新:具体而言,梯度更新必须应用于称为 的高精度权重缓冲区。这一缓冲区在稀疏混合专家(SMoE)模型中引入了 substantial 内存开销,因为模型参数和优化器状态占据主要内存。为此,我们提出了误差补偿优化器(ECO),通过对量化参数直接应用更新来消除主权重。ECO 在每一步后对权重进行量化,并将 resulting 量化误差小心地注入优化器动量中,形成一个没有额外内存的误差反馈环。我们证明,在衰减学习率的标准假设下,ECO 收敛于最优处常数半径的邻域,而 naïve 的主权重移除会导致误差与学习率成反比。我们展示了在小型 Transformer(30-800M)、Gemma-3 1B 模型、2.1B 参数稀疏 MoE 模型上进行 FP8 量化,以及对 DeepSeek-MoE-16B 进行 INT4 精度微调的实证结果。总体而言,ECO 在保有 master weights 的基线模型上达到近乎无损的准确性,显著推动了静态内存与验证损失的 Pareto 前沿。
引用
@article{arxiv.2601.22101,
title = {ECO: Quantized Training without Full-Precision Master Weights},
author = {Mahdi Nikdan and Amir Zandieh and Dan Alistarh and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2601.22101},
year = {2026}
}