AMXFP4:利用非对称微缩放浮点数抑制激活异常值以实现 4-bit LLM 推理
人工智能
2025-06-02 v2
摘要
随着大语言模型(LLM)的参数规模和上下文长度增长,计算精度已从 16-bit 降至 4-bit 以提高推理效率。然而,这种降低会因激活异常值导致精度下降。基于旋转的 INT4 方法通过矩阵校准解决此问题,但会引入数小时的开销,且关键计算仍保持全精度。微缩放(MX)浮点数(FP)格式提供带共享尺度的细粒度表示,无需校准即可通过直接转换实现全量化矩阵乘法。然而,现有研究显示 MXFP4 推理的实验结果不尽如人意,MX 格式的鲁棒性在很大程度上仍未被探索。本工作揭示了 MX 格式的基本权衡:虽然它能有效抑制激活异常值,但代价是增加了组内不对称性。为此,我们提出 AMXFP4,一种 4-bit 非对称 FP 格式,利用非对称共享尺度同时解决这两个问题,且无需校准。我们的定制 MAC 引擎在几乎不增加硬件成本的情况下提升了精度:AMXFP4 在 VQA 上比 MXFP4 高 3%,在 CSQA 上比基于旋转的方法高 1.6%。它还超越了最近部署的商用 MXFP4 变体。代码:https://github.com/aiha-lab/MX-QLLM
引用
@article{arxiv.2411.09909,
title = {AMXFP4: Taming Activation Outliers with Asymmetric Microscaling Floating-Point for 4-bit LLM Inference},
author = {Janghwan Lee and Jiwoong Park and Jinseok Kim and Yongjik Kim and Jungju Oh and Jinwook Oh and Jungwook Choi},
journal= {arXiv preprint arXiv:2411.09909},
year = {2025}
}
备注
Updated formatting