中文

APHQ-ViT:基于平均扰动 Hessian 的视觉 Transformer 后训练量化重建

机器学习 2025-04-04 v1 计算与语言

摘要

视觉 Transformer (ViT) 已成为视觉任务中最常用的 backbone 之一。尽管其在各类视觉任务中表现卓越,但在实际部署时进行量化往往导致显著的精度下降,尤其是后训练量化 (PTQ) 在超低位宽下的表现尤为突出。最近,基于重建的 PTQ 方法在量化卷积神经网络 (CNN) 时显示出良好的性能,但在 ViT 上应用时效果不佳,主要由于对输出重要性估计不准确以及对后 GELU 激活函数量化导致的显著精度退化。为此,我们提出了 APHQ-ViT,一种基于平均扰动 Hessian (APH) 的重要性估计的 PTQ 方法。具体而言,我们对当前基于 Hessian loss 的近似方法进行了深入分析,提出了改进的平均扰动 Hessian loss。为了处理后 GELU 激活函数的量化,我们设计了一种 MLP 重建 (MR) 方法,通过将 GELU 函数中的 MLP 部分替换为 ReLU,并在小型无标签校准集上应用 APH loss 进行重建。大量实验表明,APHQ-ViT 使用线性量化器在 3 位和 4 位的不同视觉任务中均显著优于现有的 PTQ 方法。源代码已公开:https://github.com/GoatWu/APHQ-ViT。

关键词

引用

@article{arxiv.2504.02507,
  title  = {ZClip: Adaptive Spike Mitigation for LLM Pre-Training},
  author = {Abhay Kumar and Louis Owen and Nilabhra Roy Chowdhury and Fabian Güra},
  journal= {arXiv preprint arXiv:2504.02507},
  year   = {2025}
}