中文

LATMiX:用于 LLM 微量化的可学习仿射变换

机器学习 2026-04-27 v2 计算与语言

摘要

后训练量化(PTQ)是降低大语言模型(LLMs)内存和计算成本的常用方法。最近的研究表明,对激活应用可逆变换可显著提高量化鲁棒性,通过减少激活离群值实现;然而,现有方法基本局限于旋转或哈达巴(Hadamard)变换。此外,大多数研究主要关注传统量化方案,而现代硬件日益支持微量化(MX)数据格式。尝试将两者结合时表现严重下降,导致先前工作引入对变换的假设。在本工作中,我们采取互补视角。首先,我们通过推导量化误差上界,对 MX 量化下的变换进行理论分析。我们的分析强调,必须同时考虑激活分布和底层量化结构的重要性。基于此分析,我们提出了 LATMiX,该方法将离群值消除泛化为使用标准深度学习工具优化的可学习仿射变换。实验表明,在多个零样本基准中,LATMiX 在 MX 低位量化上相对于强大基线实现持续的平均准确率提升。

关键词

引用

@article{arxiv.2602.17681,
  title  = {LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs},
  author = {Ofir Gordon and Lior Dikstein and Arnon Netzer and Idan Achituve and Hai Victor Habi},
  journal= {arXiv preprint arXiv:2602.17681},
  year   = {2026}
}

备注

32 pages, 6 figures