中文

在原生 FP4 硬件上使用 MXFP4 预训练大语言模型

机器学习 2026-05-15 v3 人工智能

摘要

为什么大语言模型的全流程 FP4 训练经常发散,即使前向激活和激活梯度保持稳定?我们通过对 Transformer 训练中 MXFP4 量化的受控研究来解决这个问题,在前向传播(Fprop)、激活梯度(Dgrad)和权重梯度(Wgrad)中逐步启用 FP4,同时保持所有其他因素不变。在 C4 数据集上对 Llama 3.1-8B 进行完整预训练时,我们观察到量化 Wgrad 是收敛退化的主要驱动因素,而仅在 Fprop 和 Dgrad 中使用 FP4 只引入了适度的额外 token 需求。为了解释这一行为,我们在受控实验设置下评估了结构化和随机干预。我们发现,一旦 Wgrad 被量化,随机舍入和随机 Hadamard 旋转便无法稳定训练,而确定性 Hadamard 旋转则能持续恢复稳定的优化。这些结果表明,FP4 训练不稳定性是由敏感梯度路径上的结构化微缩放误差驱动的,而非由随机性不足引起。我们在 AMD Instinct MI355X GPU 上使用原生 MXFP4 支持进行实验,从而能够在不依赖软件仿真的情况下对这些效应进行受控研究。

关键词

引用

@article{arxiv.2605.09825,
  title  = {Pretraining large language models with MXFP4 on Native FP4 Hardware},
  author = {Musa Cim and Poovaiah Palangappa and Miro Hodak and Ravi Dwivedula and Meena Arunachalam and Mahmut Taylan Kandemir},
  journal= {arXiv preprint arXiv:2605.09825},
  year   = {2026}
}