中文

I-ViT:面向高效视觉Transformer推理的全整数量化

计算机视觉与模式识别 2023-08-08 v4

摘要

视觉Transformer(ViT)已在多种计算机视觉应用中取得最先进的性能。然而,这些模型具有可观的存储与计算开销,使其在海端设备上的部署与高效推理颇具挑战。量化是降低模型复杂度的一种有前景的方法,而二进算术流水线可使量化模型执行高效的全整数推理。遗憾的是,二进算术基于卷积神经网络中的同质性条件,这不适用于ViT中的非线性组件,使得ViT的全整数推理成为一个开放问题。本文中,我们提出I-ViT,一种面向ViT的整数仅量化方案,使ViT能够利用整数算术与位移位完成整个推理计算图,且不含任何浮点算术。在I-ViT中,线性操作(如MatMul与Dense)遵循带二进算术的整数仅流水线,而非线性操作(如Softmax、GELU与LayerNorm)由所提出的轻量级整数仅算术方法近似。更具体地,I-ViT采用所提出的Shiftmax与ShiftGELU,其设计利用整数位移位来近似相应的浮点操作。我们在多种基准模型上评估I-ViT,结果表明整数仅INT8量化取得了与全精度(FP)基线相当(甚至略高)的精度。此外,我们利用TVM在GPU的整数算术单元上进行实际硬件部署,相比FP模型实现了3.72\sim4.11×\times的推理加速。Pytorch与TVM的代码发布于https://github.com/zkkli/I-ViT。

关键词

引用

@article{arxiv.2207.01405,
  title  = {I-ViT: Integer-only Quantization for Efficient Vision Transformer Inference},
  author = {Zhikai Li and Qingyi Gu},
  journal= {arXiv preprint arXiv:2207.01405},
  year   = {2023}
}

备注

ICCV 2023