跨越微标量 FP4 量化的承诺与性能之间的鸿沟
机器学习
2026-03-04 v3
摘要
近期硬件加速的微标量 4 位浮点格式(如 MXFP4 和 NVFP4),在 NVIDIA 和 AMD GPU 上得到支持,声称能颠覆大型语言模型(LLM)推理。然而,其实际收益尚未得到验证。本文首次系统地研究 MXFP4 和 NVFP4 的后训练量化,揭示了其承诺与实际性能之间的差距。我们的分析表明,当前最先进的方法在 FP4 上困难求胜,原因在于:(1)NVFP4 的小组规模不可避免地中和了传统的异常值缓解技术;(2)MXFP4 的二进制幂度量标量显著降低精度,因而引入高误差。为弥合这一鸿沟,我们引入 Micro-Rotated-GPTQ(MR-GPTQ),这是一种针对 FP4 独特性质进行量化过程调优的 GPTQ 量化算法变体,采用块状 Hadamard 变换和格式特定的优化。我们提供一套高性能 GPU 内核,实现 MR-GPTQ 格式的低开销,方法是将旋转融合到权重中,并实现激活的快速在线计算。这使其在 NVIDIA B200 上相较于 FP16 达到最高 3.6 倍的分层加速,端到端加速 2.2 倍;在 RTX5090 上分别达到 6 倍和 4 倍的加速。我们的广泛实证评估表明,MR-GPTQ 在准确率上与当前最先进方法持平或更好,显著提升了 MXFP4 的表现,甚至可接近 NVFP4 的准确率。我们指出,尽管 FP4 并非 INT4 的自动升级,但诸如 MR-GPTQ 之类的格式专用方法可开启准确率-性能权衡的新局面。
引用
@article{arxiv.2509.23202,
title = {Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization},
author = {Vage Egiazarian and Roberto L. Castro and Denis Kuznedelev and Andrei Panferov and Eldar Kurtic and Shubhra Pandit and Alexandre Marques and Mark Kurtz and Saleh Ashkboos and Torsten Hoefler and Dan Alistarh},
journal= {arXiv preprint arXiv:2509.23202},
year = {2026}
}