中文

FAAR:针对NVFP4格式的格式感知自适应四舍五入

机器学习 2026-03-25 v1 人工智能

摘要

在边缘设备上部署大型语言模型(LLM)需要极低位的量化。超低精度格式如NVFP4为减少内存占用和加速计算提供了可行方案。然而,现有的量化方法通常依赖传统的四舍五入策略,未能考虑NVFP4数值网格的非均匀性,导致四舍五入决策次优并放大量化误差。为此,本文提出格式感知自适应四舍五入(FAAR),一种针对NVFP4格式的可学习四舍五入策略。与常规量化范例不同,FAAR将非均匀NVFP4网格显式纳入优化过程。通过基于损失梯度自适应调整四舍五入决策,我们的方法有效逼近理论上最优的量化。为配合FAAR,本文引入2阶段格式对齐(2FA)微调方案,逐层将LLM参数对齐至NVFP4数值空间,从而进一步缩小性能差距。惊人的是,这种可学习的优化仅需在Llama3-1B上花费约4个GPU小时。广泛的实验表明,我们的方法有效。相较于最近四舍五入(RTN),本方法在Llama3-1B上将WikiText-2的困惑度从14.28降至12.60,在Qwen3-1.7B上从23.06降至21.27。此外,在各种零样本下游任务中,我们的方法始终优于最先进的方法。

关键词

引用

@article{arxiv.2603.22370,
  title  = {FAAR: Format-Aware Adaptive Rounding for NVFP4},
  author = {Hanglin Li and Shuchang Tian and Chen Lin and Zhiyong Zhao and Kun Zhan},
  journal= {arXiv preprint arXiv:2603.22370},
  year   = {2026}
}