中文

GPTAQ:面向非对称校准的高效无微调量化

机器学习 2025-05-15 v3

摘要

我们提出GPTAQ,一种用于压缩大规模Transformer架构的无微调量化方法。不同于之前的GPTQ方法,该方法独立校准每个层,GPTAQ始终将量化层的输出匹配到全精度模型中的确切输出,从而形成我们称为非对称校准的方案。该方案能有效减少先前层积累的量化误差。我们利用最优脑压缩工具对此问题进行分析,推导出闭式解。新解显式地最小化量化误差以及积累的非对称误差。此外,我们利用多种技术实现方案计算的并行化,包括通道并行化、神经元分解以及Cholesky改写以实现矩阵融合。结果表明,GPTAQ实现简单,仅需比GPTQ多写20行代码,却在低位量化下显著提升性能。在单张GPU上,我们将405B语言Transformer以及EVA-02——实现90%预训练ImageNet准确率的排名第一视觉Transformer进行量化。代码已在Github上提供。

关键词

引用

@article{arxiv.2504.02692,
  title  = {GPTAQ: Efficient Finetuning-Free Quantization for Asymmetric Calibration},
  author = {Yuhang Li and Ruokai Yin and Donghyun Lee and Shiting Xiao and Priyadarshini Panda},
  journal= {arXiv preprint arXiv:2504.02692},
  year   = {2025}
}

备注

ICML 2025