TSPTQ-ViT:面向视觉Transformer的双尺度训练后量化
图像与视频处理
2023-05-23 v1
摘要
视觉Transformer(ViTs)在各种计算机视觉任务中取得卓越性能。然而,密集的内存与计算需求阻碍ViTs在资源受限边缘设备运行。由于Softmax与GeLU后数值非正态分布,ViTs的训练后量化导致严重精度退化。此外,常规方法未能解决LayerNorm中高通道间方差。为减少量化损失并提升分类精度,我们提出一种双尺度训练后量化方案用于视觉Transformer(TSPTQ-ViT)。我们设计专用于Softmax后与GeLU后数值的值感知双尺度缩放因子(V-2SF),其利用非正态分布中的位稀疏性节省位宽。此外,离群值感知双尺度缩放因子(O-2SF)被引入LayerNorm,缓解离群值的支配性影响。实验结果表明,所提方法在ImageNet分类任务下8位全量化ViTs达到近无损精度下降(<0.5%)。
引用
@article{arxiv.2305.12901,
title = {TSPTQ-ViT: Two-scaled post-training quantization for vision transformer},
author = {Yu-Shan Tai and Ming-Guang Lin and An-Yeu and Wu},
journal= {arXiv preprint arXiv:2305.12901},
year = {2023}
}