WUSH:面向 LLM 量化的近最优自适应变换
机器学习
2026-02-03 v2
摘要
对 LLM 权重和激活进行量化是高效部署的标准做法,但少数极端异常值会扩大动态范围并放大低位量化误差。先前的基于变换的缓解措施(例如哈达赫旋转)是固定的且数据不可知的,其量化最优性尚未明了。我们在标准 RTN AbsMax 比例块量化器下,推导了联合权重-激活量化的闭式最优线性分块变换,涵盖整数和浮点格式。 resulting construction (WUSH) 将哈达赫主干与数据依赖的二阶矩组件组合,形成一种非正交变换,在温和假设下对 FP 和 INT 量化器几乎最优,同时允许高效的融合 GPU 实现。经验上,WUSH 在 W4A4 精度上优于最强的哈达赫基线(例如在 Llama-3.1-8B-Instruct 的 MXFP4 中,RTN 时提升 +2.8 平均分,GPTQ 时提升 +0.7),同时通过 FP4 MatMul 实现对 BF16 的最高 6.6 倍层级吞吐。源码已公开于 https://github.com/IST-DASLab/WUSH。
引用
@article{arxiv.2512.00956,
title = {WUSH: Near-Optimal Adaptive Transforms for LLM Quantization},
author = {Jiale Chen and Vage Egiazarian and Roberto L. Castro and Torsten Hoefler and Dan Alistarh},
journal= {arXiv preprint arXiv:2512.00956},
year = {2026}
}