APHQ-ViT:基于平均扰动 Hessian 重构的视觉 Transformer 后训练量化
计算机视觉与模式识别
2025-04-04 v1
摘要
视觉 Transformer (ViT) 已成为视觉任务中最常用的 backbone 之一。尽管其性能卓越,但在实际部署时进行后训练量化 (PTQ) 尤其是在超低位宽情况下,往往会出现显著的精度下降。最近,基于重构的 PTQ 方法在量化卷积神经网络 (CNN) 时显示出良好的性能,但无法直接应用于 ViT,主要由于对输出重要性估计不准确以及量化后 GELU 激活函数导致的显著精度降低。为此,我们提出了一种基于平均扰动 Hessian (APH) 重要性估计的 novel PTQ 方法——APHQ-ViT。具体地,我们首先深入分析当前基于 Hessian 损失的近似方法,并提出改进的平均扰动 Hessian 损失。为处理后 GELU 激活函数的量化,我们设计了一种 MLP 重构 (MR) 方法,通过将 MLP 中的 GELU 函数替换为 ReLU,并在小型无标签校准集上使用 APH 损失进行重构。大量实验表明,APHQ-ViT 使用线性量化器在 3 位和 4 位 across 不同视觉任务中均显著优于现有的 PTQ 方法。源码已公开于 https://github.com/GoatWu/APHQ-ViT。
引用
@article{arxiv.2504.02508,
title = {APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformers},
author = {Zhuguanyu Wu and Jiayi Zhang and Jiaxin Chen and Jinyang Guo and Di Huang and Yunhong Wang},
journal= {arXiv preprint arXiv:2504.02508},
year = {2025}
}
备注
Accepted to CVPR 2025