MOSS:基于微标量和自动标量的高效精准 FP8 LLM 训练
机器学习
2025-12-08 v2 人工智能
摘要
使用 FP8 格式训练大语言模型可实现显著的效率提升。然而,FP8 的降低数值精度为稳定和准确训练带来了挑战。当前框架通过 mixed-granularity 量化保留训练性能,即对 activations 应用 per-group 量化,对 weights 应用 per-tensor/block 量化。虽然有效,但 per-group 量化需要在矩阵乘法的内维度上进行 scaling,引入额外的 dequantization 开销。此外,这些框架常依赖 just-in-time scaling 来动态调整 scaling factors based on 当前数据分布。然而,这种 online 量化对 FP8 训练效率低下,因为它涉及多个 memory 读取和写入,抵消了 FP8 性能收益。为克服这些限制,我们提出了 MOSS,一种确保效率和数值稳定性的 FP8 训练框架。MOSS 引入两个关键创新:(1) 针对敏感 activations 引入 two-level microscaling 策略,通过结合高精度 global scale 与紧凑、以 2 的幂为 local scale 来平衡 precision 和 dequantization 成本;(2) 对 linear layers 中的 weights 引入 automatic scaling,消除昂贵的 max-reduction 操作,通过预测和调整 training 中的 scaling factors。依托这些技术,MOSS 实现了对 7B 参数模型的高效 FP8 训练,达到与 BF16 baseline 相当的性能,同时实现最高 34% 的训练吞吐量提升。
引用
@article{arxiv.2511.05811,
title = {MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling},
author = {Yu Zhang and Hui-Ling Zhen and Mingxuan Yuan and Bei Yu},
journal= {arXiv preprint arXiv:2511.05811},
year = {2025}
}