Q-ViT:面向视觉Transformer的全可微量化
计算机视觉与模式识别
2022-09-07 v2
摘要
在本文中,我们提出一种面向视觉Transformer(ViT)的全可微量化方法,称为Q-ViT,其中量化尺度和位宽均为可学习参数。具体而言,基于我们观察到的ViT中的注意力头表现出不同的量化鲁棒性,我们利用头级位宽来压缩Q-ViT的尺寸同时保持性能。此外,我们提出一种名为可切换尺度的新技术,以解决量化尺度与位宽联合训练中的收敛问题。以此方式,Q-ViT将ViT量化的极限推进至3-bit而无严重性能下降。而且,我们分析了ViT每个架构组件的量化鲁棒性,并表明多头自注意力(MSA)和高斯误差线性单元(GELU)是ViT量化的关键方面。本研究为进一步的ViT量化研究提供了一些见解。在不同ViT模型(如DeiT和Swin Transformer)上的大量实验显示了我们量化方法的有效性。特别地,我们的方法在DeiT-Tiny上比最先进的均匀量化方法高出1.5%。
引用
@article{arxiv.2201.07703,
title = {Q-ViT: Fully Differentiable Quantization for Vision Transformer},
author = {Zhexin Li and Tong Yang and Peisong Wang and Jian Cheng},
journal= {arXiv preprint arXiv:2201.07703},
year = {2022}
}