中文

推动后训练量化中块旋转的极限

机器学习 2026-05-29 v2 人工智能

摘要

最近的后训练量化(PTQ)方法采用块旋转来在舍入前扩散异常值。虽然这减少了在线全向量旋转的开销,但块结构对异常值抑制的影响仍知之甚少。为填补这一空白,我们首次对块Hadamard旋转的异常值抑制进行了系统的、非渐近的分析。我们的分析揭示,异常值抑制从根本上受限于输入向量的几何结构。特别地,在确定性最坏情况下,当旋转前的1\ell_1范数质量均匀分布在各个块上时,旋转后的异常值最小。在这些见解的指导下,我们引入了PeRQ(排列、旋转、然后量化),一种在旋转前通过排列重新分配激活质量的PTQ框架。我们提出了一种贪婪质量扩散算法,通过均衡期望的逐块1\ell_1范数来校准排列。为避免增加推理开销,我们识别了Transformer架构中的置换等变区域,以便在部署前将这些排列合并到模型权重中。实验表明,PeRQ在所有块大小上一致地提高了精度,在将Llama3 1B量化为块大小为16的INT4时,恢复了全向量旋转困惑度的90%,而在没有排列的情况下仅为46%。

关键词

引用

@article{arxiv.2601.22347,
  title  = {Pushing the Limits of Block Rotations in Post-Training Quantization},
  author = {Sai Sanjeet and Ian Colbert and Pablo Monteagudo-Lago and Giuseppe Franco and Yaman Umuroglu and Nicholas J. Fraser},
  journal= {arXiv preprint arXiv:2601.22347},
  year   = {2026}
}