中文

诊断 FP4 推理:NVFP4 和 MXFP4 的层级和分块敏感性分析

硬件体系结构 2026-03-11 v1 人工智能

摘要

量化化学解决了大型语言模型(LLM)的高资源需求问题,通过减轻内存压力和带宽拥堵,在可接受的精度损失下提供了显著的计算能力提升。四位浮点(FP4)是能够保留essential数值属性(如指数和符号)的最低精度格式,已开始在黑曼和AMD CDNA等前沿架构中采用,以支持LLM量化和降低部署成本。尽管激进量化可获得效率收益,但Transformer层内部的量化灵敏度以及这些灵敏度是否在现有FP4格式和模型规模之间普遍化,仍未得到充分探索。为阐明量化灵敏度,本研究系统性地分析了两种FP4格式(MXFP4和NVFP4),在三个Qwen2.5模型规模(0.5B、7B和14B)上,使用受控的组件级和分块级隔离方法。我们观察到,MLP升投影和降投影层在灵敏度方面始终占主导地位,而门和注意力投影则对FP4量化的灵敏度分别较低和显著。我们进一步发现,灵敏度并不普遍局限于最终块,特别是在MXFP4下,早期块可以非常灵敏。我们的结果为FP4在组件、深度和格式方面的推理行为提供了诊断性特征描述。

关键词

引用

@article{arxiv.2603.08747,
  title  = {Diagnosing FP4 inference: a layer-wise and block-wise sensitivity analysis of NVFP4 and MXFP4},
  author = {Musa Cim and Burak Topcu and Mahmut Taylan Kandemir},
  journal= {arXiv preprint arXiv:2603.08747},
  year   = {2026}
}