Quartet II:NVFP4 格式下基于改进无偏梯度估计的精确大语言模型预训练
机器学习
2026-02-02 v1
摘要
NVFP4 低精度格式由 NVIDIA Blackwell GPU 硬件支持,首次允许对诸如大型语言模型之类的巨型模型进行端到端全量化预训练。然而,现有的量化训练方法仍在偏好更准确无偏量化梯度估计的随机取整 (SR) 的情况下牺牲了该格式的一些表示容量,相较于标准 FP16 和 FP8 训练失去显著的准确性。本文通过一种名为 MS-EDEN 的 novel 无偏量化例程,用于微观缩放格式,实现了比 SR 更高 2 倍以上的量化误差。我们将其集成到一种名为 Quartet II 的 novel 全 NVFP4 量化方案中,用于线性层。我们在正式分析中表明,Quartet II 在所有主要矩阵乘法上,无论是前向还是反向传递,都实现了持续更好的梯度估计。此外,我们的方案与最近专为 NVFP4 设计的训练改进措施协同作用良好。我们进一步在 380 亿 token 上对 19 亿参数的 LLM 进行端到端训练中验证了 Quartet II。我们提供可在 NVIDIA Blackwell GPU 上执行的 kernel,相较于 BF16 可实现最高 4.2 倍的加速。我们的代码已公开于 https://github.com/IST-DASLab/Quartet-II。
引用
@article{arxiv.2601.22813,
title = {Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation},
author = {Andrei Panferov and Erik Schultheis and Soroush Tabesh and Dan Alistarh},
journal= {arXiv preprint arXiv:2601.22813},
year = {2026}
}