四分之六:基于自适应块缩放的 NVFP4 量化更精准
计算与语言
2026-05-12 v5 机器学习
摘要
随着大语言模型规模的不断增大,针对低精度数值格式(如 NVFP4)以提高速度和降低内存使用的兴趣也随之增长。然而,NVFP4 量化模型仍具有挑战性,因为精度不足通常会导致模型性能下降。本文通过 Four Over Six (4/6) 方案来解决此问题,这是一种对块缩放 NVFP4 量化算法的修改,可产生更低的量化误差。不同于整数格式,浮点格式具有非均匀的步长,这会在较大的值上产生更大的量化误差。4/6 利用这一点,通过自适应缩放一些块以更小的 FP4 值,使可表示值的分布更均匀,从而降低对接近最大值的值的误差。我们展示 4/6 可在现代硬件加速器上高效实现,实现了在预训练和推理中的性能提升,同时几乎没有计算开销。在针对 Nemotron 3 Nano 30B-A3B 模型架构的预训练实验中,我们发现 4/6 使训练损失更接近 BF16,优于当前用于 NVFP4 训练的最新配方。我们的代码已发布于 https://github.com/mit-han-lab/fouroversix。
引用
@article{arxiv.2512.02010,
title = {Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling},
author = {Jack Cook and Junxian Guo and Guangxuan Xiao and Yujun Lin and Keith Wyss and Mahdi Nazemi and Asit Mishra and Carlo del Mundo and Tijmen Blankevoort and Song Han},
journal= {arXiv preprint arXiv:2512.02010},
year = {2026}
}
备注
10 pages, 4 figures