Metis:基于 FP4 量化训练大语言模型
机器学习
2025-10-01 v4
摘要
本文识别出参数、激活值和梯度的奇异值谱中的各向异性性是大规模语言模型(LLM)低位训练的根本障碍。这些谱以少数大奇异值的主导形式出现,导致数值范围广泛,引起量化偏差和严重的谱衰变,最终降低训练性能。本文提出 Metis,一种谱域量化框架,将各向异性谱划分为更窄的子分布进行独立量化,从而降低误差并保持谱结构。为最小化开销,Metis 利用主导谱子空间的两个关键特性:稀疏随机抽样实现保持,随机投影实现保持,将分解成本降低到可忽略的水平。在使用 1000 亿 token 训练的 LLaMA-3 8B 上,Metis 实现了基于 FP4 量化的稳健 W4A4G4 训练(对权重、激活值和梯度进行 FP4 量化),仅产生 0.4% 的训练损失间隙和 0.1% 的下游准确率下降,相较于 BF16。除匹配 BF16 的保真度外,Metis 还超越了我们实现的 Nvidia 最近宣布(尚未公开发布)的 FP4 配方,始终实现更低的损失和更高的下游准确率,同时计算开销显著降低。Metis 的代码实现已公开于:https://anonymous.4open.science/r/Metis-quantization-644B。
引用
@article{arxiv.2509.00404,
title = {Metis: Training LLMs with FP4 Quantization},
author = {Hengjie Cao and Mengyi Chen and Yifeng Yang and Ruijun Huang and Fang Dong and Jixian Zhou and Anrui Chen and Mingzhi Dong and Yujiang Wang and Jinlong Hou and Yuan Cheng and Fan Wu and Fan Yang and Tun Lu and Ning Gu and Li Shang},
journal= {arXiv preprint arXiv:2509.00404},
year = {2025}
}