Ascend NPU 上的 HiFloat4 格式用于语言模型预训练
机器学习
2026-04-13 v1 人工智能
计算与语言
摘要
大型基础模型已成为现代机器学习的核心,其性能按预期随模型规模和数据量而提升。然而,训练和部署此类模型会产生巨大的计算和内存成本,推动了低精度训练技术的发展。最近的研究表明,4 位浮点格式 (FP4) 如 MXFP4 和 NVFP4 可成功应用于大型语言模型 (LLM) 中的线性 GEMM 操作,较高精度基准实现计算吞吐量和内存效率提升最高可达 4 倍。本文我们探讨了最近提出的 HiFloat4 FP4 格式在华为 Ascend NPU 上的应用,并系统地将其与 MXFP4 在大规模训练设置中进行比较。所有实验均在 Ascend NPU 集群上进行,线性和专家 GEMM 操作完全以 FP4 精度执行。我们评估了稠密架构(如 Pangu 和 LLaMA 风格模型)和混合专家 (MoE) 模型,其中标准线性层和专家专用 GEMM 均以 FP4 运行。此外,我们探索了针对 FP4 训练的稳定技术,显著降低数值退化,保持相对误差在 1% 范围内,同时保留 4 位计算的效率优势。我们的结果提供了 FP4 在 NPU 上进行大规模稠密和 MoE 模型训练的全面实证研究,突显了 FP4 格式在大规模稠密和 MoE 模型之间的实际权衡。
关键词
引用
@article{arxiv.2604.08826,
title = {HiFloat4 Format for Language Model Pre-training on Ascend NPUs},
author = {Mehran Taghian and Yunke Peng and Xing Huang and Yao Wang and Yaoyuan Wang and Wei Guo and Yuanyong Luo and Tianchi Hu and Junsong Wang and Xin Wang and Hu Liu and Yu Cheng and Ziwei Yu and Hongliang Li and Mehdi Rahimifar and Lei Yan and Xuefei Wang and Zhuang Ma and Lei Liu and Hui Yu and Anandharaju Durai Raju and Hoang Le and Hei Yi Mak and Tanzila Rahman and Shadan Golestan},
journal= {arXiv preprint arXiv:2604.08826},
year = {2026}
}