中文

PTQ4ViT:面向视觉Transformer的双均匀量化后训练量化

计算机视觉与模式识别 2024-06-25 v3

摘要

量化是压缩神经网络最有效的方法之一,已在卷积神经网络(CNN)上取得巨大成功。近期,视觉Transformer在计算机视觉领域展现出巨大潜力。然而,先前的后训练量化方法在视觉Transformer上表现不佳,即使在8位量化下也会导致超过1%的精度下降。因此,我们分析了视觉Transformer量化中存在的问题。我们观察到,经过Softmax和GELU函数后的激活值分布与高斯分布差异显著。我们还观察到,常用的量化度量指标,如均方误差(MSE)和余弦距离,在确定最优缩放因子时并不准确。本文提出双均匀量化方法,以降低这些激活值上的量化误差。同时,我们提出使用Hessian引导的度量来评估不同的缩放因子,以较小的代价提高了校准精度。为实现视觉Transformer的快速量化,我们开发了一个高效框架PTQ4ViT。实验表明,量化后的视觉Transformer在ImageNet分类任务上实现了近乎无损的预测精度(8位量化下精度下降小于0.5%)。

关键词

引用

@article{arxiv.2111.12293,
  title  = {PTQ4ViT: Post-training quantization for vision transformers with twin uniform quantization},
  author = {Zhihang Yuan and Chenhao Xue and Yiqi Chen and Qiang Wu and Guangyu Sun},
  journal= {arXiv preprint arXiv:2111.12293},
  year   = {2024}
}