更细粒度更好吗?大型语言模型中微量化格式的极限
机器学习
2026-01-28 v1 硬件体系结构
计算与语言
摘要
微量化数据格式通过逐块张量量化,实现了在精度损失有限的情况下的激进模型压缩。 unlocked其潜能以实现高效训练和推理,需要硬件友好的实现方式,这些实现方式在本机格式上进行矩阵乘法并采用高效的误差缓解策略。本文报告了与微量化量化相关的一种惊人现象,即块大小降低到某个阈值以下后,量化模型的输出会退化。这种现象与 smaller block size 应允许更好地表示张量元素这一预期相冲突。我们既通过实验又通过理论方式探讨了这一现象,分离其背后量化误差的来源。实验方面,我们分析了几个大型语言模型的分布,确定驱动该异常行为的条件。理论方面,我们建立了一个框架,与来自预训练模型分布和理想分布的实验数据高度吻合。总体而言,我们显示,异常现象由窄张量分布与量化尺度的有限动态范围之间的相互作用驱动。基于这些见解,我们提出在FP4微量化数据类型中使用FP8无符号E5M3(UE5M3)作为尺度的一种新型硬件友好格式。我们展示,UE5M3在性能上与传统FP8无符号E4M3尺度相当,同时消除了对权重和激活进行全局缩放操作的需求。
引用
@article{arxiv.2601.19026,
title = {Is Finer Better? The Limits of Microscaling Formats in Large Language Models},
author = {Andrea Fasoli and Monodeep Kar and Chi-Chun Liu and Swagath Venkataramani and Viji Srinivasan and Leland Chang and Naigang Wang},
journal= {arXiv preprint arXiv:2601.19026},
year = {2026}
}
备注
31 pages, 17 figures, 3 tables; accepted to ICLR 2026