PolarQuant:基于Hadamard旋转实现LLM权重的最优高斯量化
计算与语言
2026-04-22 v2 机器学习
摘要
我们提出PolarQuant,这是一种针对大型语言模型(LLMs)的后训练权重量化方法,利用神经网络权重的分布结构实现近乎无损压缩。PolarQuant包含三个阶段:(1)块级归一化至单位超球面;(2)Walsh-Hadamard旋转将坐标变换为近似高斯随机变量;(3)以匹配高斯分布的质心进行量化。我们的消融实验表明,Hadamard旋转alone即可 accounts for 98%的质量提升,将Qwen3.5-9B的perplexity从6.90(使用absmax Q5)降至6.40(与FP16仅差+0.03),在无需校准数据的情况下实现实用无损。进一步地,PolarQuant可作为下游INT4量化器的有效预处理步骤:PolarQuant Q5经去量化再量化后使用torchao INT4,perplexity为6.56,而直接使用absmax INT4仅为6.68,同时保持43.1 tok/s的吞吐量和6.5 GB的VRAM占用。代码和模型已公开。
引用
@article{arxiv.2603.29078,
title = {PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression},
author = {Caio Vicentino},
journal= {arXiv preprint arXiv:2603.29078},
year = {2026}
}
备注
Found some errors, I need to fix