微缩放浮点格式下大语言模型训练后量化的基准评测
计算与语言
2026-01-15 v1 人工智能
摘要
微缩放浮点(MXFP)已成为大语言模型(LLMs)中一种有前景的低精度格式。尽管已有多种训练后量化(PTQ)算法被提出,但它们大多侧重于整数量化,而在 MXFP 格式下的适用性和行为在很大程度上仍未被探索。为填补这一空白,本文对 MXFP 格式下的 PTQ 进行了系统性研究,涵盖了超过 7 种 PTQ 算法、15 个评测基准和 3 个 LLM 家族。主要发现包括:1) MXFP8 始终能实现近乎无损的性能,而 MXFP4 会引入显著的精度下降,仍具挑战性;2) MXFP 下的 PTQ 有效性强烈依赖于格式兼容性,某些算法范式始终比其他范式更有效;3) PTQ 性能在不同模型家族和模态间表现出高度一致的趋势,特别是在多模态 LLM 中,量化敏感度主要由语言模型而非视觉编码器主导;4) 量化缩放因子是 MXFP4 中的一个关键误差源,一种简单的预缩放优化策略可以显著减轻其影响。这些结果共同为将现有 PTQ 方法适配于 MXFP 量化提供了实践指导。
引用
@article{arxiv.2601.09555,
title = {Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats},
author = {Manyi Zhang and Ji-Fu Li and Zhongao Sun and Haoli Bai and Hui-Ling Zhen and Zhenhua Dong and Xianzhi Yu},
journal= {arXiv preprint arXiv:2601.09555},
year = {2026}
}