中文

Q-ViT:面向视觉Transformer的全可微量化

计算机视觉与模式识别 2022-09-07 v2

摘要

在本文中,我们提出一种面向视觉Transformer(ViT)的全可微量化方法,称为Q-ViT,其中量化尺度和位宽均为可学习参数。具体而言,基于我们观察到的ViT中的注意力头表现出不同的量化鲁棒性,我们利用头级位宽来压缩Q-ViT的尺寸同时保持性能。此外,我们提出一种名为可切换尺度的新技术,以解决量化尺度与位宽联合训练中的收敛问题。以此方式,Q-ViT将ViT量化的极限推进至3-bit而无严重性能下降。而且,我们分析了ViT每个架构组件的量化鲁棒性,并表明多头自注意力(MSA)和高斯误差线性单元(GELU)是ViT量化的关键方面。本研究为进一步的ViT量化研究提供了一些见解。在不同ViT模型(如DeiT和Swin Transformer)上的大量实验显示了我们量化方法的有效性。特别地,我们的方法在DeiT-Tiny上比最先进的均匀量化方法高出1.5%。

关键词

引用

@article{arxiv.2201.07703,
  title  = {Q-ViT: Fully Differentiable Quantization for Vision Transformer},
  author = {Zhexin Li and Tong Yang and Peisong Wang and Jian Cheng},
  journal= {arXiv preprint arXiv:2201.07703},
  year   = {2022}
}