Q-HyViT:面向物联网系统的带桥接块重建的混合视觉Transformer训练后量化
计算机视觉与模式识别
2024-05-20 v3 人工智能
摘要
近来,视觉Transformer(ViTs)已在分类、检测和分割等众多应用中取代卷积神经网络。然而,ViT 的高计算需求阻碍了其广泛部署。为此,研究者提出了高效的混合Transformer架构,将卷积层与Transformer层结合,并采用线性复杂度的优化注意力计算。此外,训练后量化被提出作为降低计算需求的手段。对于移动设备,要实现 ViT 的最优加速,需要策略性地将量化技术与高效混合Transformer结构相结合。然而,此前尚无研究将量化应用于高效混合Transformer。本文中,我们发现将现有的 ViT 训练后量化(PTQ)方法用于高效混合Transformer会导致严重的精度下降,这归因于以下四个挑战:(i) 高度动态的范围,(ii) 零点溢出,(iii) 多样的归一化,以及 (iv) 有限的模型参数(5M)。为克服这些挑战,我们提出了一种新的训练后量化方法,首次对高效混合 ViT(MobileViTv1、MobileViTv2、Mobile-Former、EfficientFormerV1、EfficientFormerV2)进行量化。与现有 PTQ 方法(EasyQuant、FQ-ViT、PTQ4ViT 和 RepQ-ViT)相比,我们在 8-bit 和 6-bit 上分别平均显著提升了 17.73% 和 29.75%。我们计划在 https://gitlab.com/ones-ai/q-hyvit 发布代码。
引用
@article{arxiv.2303.12557,
title = {Q-HyViT: Post-Training Quantization of Hybrid Vision Transformers with Bridge Block Reconstruction for IoT Systems},
author = {Jemin Lee and Yongin Kwon and Sihyeong Park and Misun Yu and Jeman Park and Hwanjun Song},
journal= {arXiv preprint arXiv:2303.12557},
year = {2024}
}
备注
14 pages, 9 figures, accepted in IEEE Internet of Things Journal