中文

FP4 全程量化:大型语言模型的完整量化训练

机器学习 2025-08-12 v2 人工智能

摘要

我们首次演示了使用主要为 4 位浮点(FP4)精度进行的大型语言模型(LLM)全量化训练(FQT),在规模达 2000 亿 token 的数据集上实现。我们广泛调查了 FP4 的关键设计选择,包括块大小、缩放格式和舍入方法。我们的分析表明,NVFP4 格式——即每 16 个 FP4 值(E2M1)共享以 E4M3 表示的比例因子——能提供最佳结果。我们在反向和更新传递中采用随机舍入,在前向传递中采用最近值舍入,以提升稳定性。此外,我们识别出有效量化训练的理论和经验阈值:当梯度范数低于约 3\sqrt{3} 倍的量化噪声时,量化训练将不够有效。基于这些见解,我们成功在 256 个 Intel Gaudi2 加速器上训练了一个 70 亿参数模型。生成的 FP4 训练模型在下游任务上的性能相当于标准 BF16 基线,确认了 FP4 训练是大规模 LLM 训练的实用且高度高效的方法。参考实现已提供于 https://github.com/Anonymous1252022/fp4-all-the-way。

关键词

引用

@article{arxiv.2505.19115,
  title  = {FP4 All the Way: Fully Quantized Training of LLMs},
  author = {Brian Chmiel and Maxim Fishman and Ron Banner and Daniel Soudry},
  journal= {arXiv preprint arXiv:2505.19115},
  year   = {2025}
}