Quartet:原生 FP4 训练可为大型语言模型提供最优解
机器学习
2026-01-16 v4
摘要
以低精度直接训练大型语言模型 (LLM) 是一种通过提升吞吐量和能源效率来降低计算成本的方法。鉴于此目的,NVIDIA 的最新 Blackwell 架构支持使用 FP4 变体实现非常低精度运算。然而,当前用于 FP4 精度训练 LLM 的算法面临显著精度下降,常依赖混合精度回退。在本文中,我们调查了硬件支持的 FP4 训练,提出一种新方法,实现以 4 位精度进行准确的端到端训练,所有主要计算(即线性层)均在低精度下完成。通过在 Llama 类模型上进行大量评估,我们揭示了一种新的低精度比例定律,量化不同位宽和训练配置之间的性能权衡。基于此调查,我们设计了一种在准确率与计算资源之间达到最优平衡的“最佳”技术,称为 Quartet。我们使用针对 Blackwell 优化的 CUDA 内核实现 Quartet,证明完全基于 FP4 的训练是 FP16 半精度和 FP8 训练的有竞争力的替代方案。我们的代码已发布于 https://github.com/IST-DASLab/Quartet。
引用
@article{arxiv.2505.14669,
title = {Quartet: Native FP4 Training Can Be Optimal for Large Language Models},
author = {Roberto L. Castro and Andrei Panferov and Soroush Tabesh and Oliver Sieberling and Jiale Chen and Mahdi Nikdan and Saleh Ashkboos and Dan Alistarh},
journal= {arXiv preprint arXiv:2505.14669},
year = {2026}
}