MXFP8 预训练大型语言模型的配方
人工智能
2025-06-18 v2 机器学习
系统与控制
系统与控制
计算金融
摘要
在预训练过程中使用更少的位数表示模型参数及相关张量已成为提升GPU效率而不牺牲精度的必备技术。Microscaling(MX)格式于英特尔黑湾(NVIDIA Blackwell)GPU代数中引入,标志着该技术的重大突破,使得将狭窄浮点数据类型与更细粒度的逐块缩放因子相结合成为可行。这进一步使得比以往方法更多地对张量进行量化,并对这些张量上的运算实现更高效。有效地利用MX格式需要仔细选择各种参数。本文回顾了这些选择,并展示了使用MXFP8-E4M3数据类型及特定数值转换算法后,训练过程可与在BF16中完成的训练相当。我们呈现了使用最高达80亿参数的模型,在最高15万亿tokens的高质量数据集上进行的训练结果。
引用
@article{arxiv.2506.08026,
title = {TIP-Search: Time-Predictable Inference Scheduling for Market Prediction under Uncertain Load},
author = {Xibai Wang},
journal= {arXiv preprint arXiv:2506.08026},
year = {2025}
}