中文

TSPTQ-ViT:面向视觉Transformer的双尺度训练后量化

图像与视频处理 2023-05-23 v1

摘要

视觉Transformer(ViTs)在各种计算机视觉任务中取得卓越性能。然而,密集的内存与计算需求阻碍ViTs在资源受限边缘设备运行。由于Softmax与GeLU后数值非正态分布,ViTs的训练后量化导致严重精度退化。此外,常规方法未能解决LayerNorm中高通道间方差。为减少量化损失并提升分类精度,我们提出一种双尺度训练后量化方案用于视觉Transformer(TSPTQ-ViT)。我们设计专用于Softmax后与GeLU后数值的值感知双尺度缩放因子(V-2SF),其利用非正态分布中的位稀疏性节省位宽。此外,离群值感知双尺度缩放因子(O-2SF)被引入LayerNorm,缓解离群值的支配性影响。实验结果表明,所提方法在ImageNet分类任务下8位全量化ViTs达到近无损精度下降(<0.5%)。

关键词

引用

@article{arxiv.2305.12901,
  title  = {TSPTQ-ViT: Two-scaled post-training quantization for vision transformer},
  author = {Yu-Shan Tai and Ming-Guang Lin and An-Yeu and Wu},
  journal= {arXiv preprint arXiv:2305.12901},
  year   = {2023}
}