中文

FP8-Flow-MoE:无双重量化误差的无类型转换 FP8 配方

机器学习 2025-11-05 v1 人工智能

摘要

大型混合专家 (MoE) 模型的训练因其巨大的计算和内存需求而在计算上昂贵。虽然低精度训练可加速计算并降低内存占用,但现有实现仍依赖 BF16 主导的数据流,频繁进行量化-反量化 (Q/DQ) 转换。这些冗余的类型转换削弱了 FP8 的理论效率。然而,若通过完全采用 FP8 消除类型转换,会产生双重量化误差:沿不同维度量化的张量累积不一致的缩放因子,导致数值不稳定。我们提出 FP8-Flow-MoE,一种具有量化一致性 FP8 导向数据流的 FP8 训练配方,采用缩放感知转置和融合 FP8 运算,以简化计算并消除从 12 次显式类型转换减少至 2 次。评估 6710 亿参数 MoE 模型显示,其吞吐量提升最高可达 21%,每个 GPU 的内存使用降低 16.5 GB,相较于 BF16 和 na"ive FP8 基线,同时保持稳定收敛。我们提供与 TransformerEngine 和 Megatron-LM 兼容的即插即用 FP8 配方,计划很快开源。

关键词

引用

@article{arxiv.2511.02302,
  title  = {FP8-Flow-MoE: A Casting-Free FP8 Recipe without Double Quantization Error},
  author = {Fengjuan Wang and Zhiyi Su and Xingzhu Hu and Cheng Wang and Mou Sun},
  journal= {arXiv preprint arXiv:2511.02302},
  year   = {2025}
}