FP4 量化 LLM 训练中的均值偏置:诅咒与祝福
机器学习
2026-03-12 v1 人工智能
摘要
在自然语言上训练的大语言模型表现出显著的各向异性:少数方向浓缩了不成比例的能量,而剩余维度形成广泛的语义尾部。在低位训练中,这种几何结构变得数值上不稳定。由于块状量化尺度由极端元素级幅度决定,主导方向会拉伸动态范围,将长尾语义变化压缩到狭窄的数值区间中。我们表明,这种不稳定性主要由一个一致的秩一均值偏置驱动,该偏置构成 LLM 表示中谱各向异性的主要成分。这种均值分量在各层和训练阶段中系统性地出现,并占据极端激活幅度的绝大部分,使其成为低精度下动态范围扩张的主要驱动力。关键的是,由于主导不稳定性是秩一的,因此可以通过简单的源级均值减法操作来消除。这种基于偏置的条件方法在仅使用 reduction 操作和标准量化内核的情况下,恢复了大部分 SVD 基于谱方法的稳定性优势。实验在 FP4(W4A4G4)训练中表明,均值消除显著缩小了与 BF16 之间的损失差距,并恢复了下游性能,为稳定的低位 LLM 训练提供了硬件高效的路径。
引用
@article{arxiv.2603.10444,
title = {The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training},
author = {Hengjie Cao and Zhendong Huang and Mengyi Chen and Yifeng Yang and Fanqi Yu and Ruijun Huang and Fang Dong and Xin Zhang and Jixian Zhou and Anrui Chen and Mingzhi Dong and Yujiang Wang and Jinlong Hou and Qin Lv and Yuan Cheng and Tun Lu and Fan Yang and Li Shang},
journal= {arXiv preprint arXiv:2603.10444},
year = {2026}
}