Bi-ViT:推进视觉 Transformer 量化的极限
计算机视觉与模式识别
2023-05-23 v1
摘要
视觉 Transformer(ViTs)量化为实现在资源受限设备上部署大型预训练网络提供了广阔前景。将 ViT 量化推至极限的全二值化 ViTs(Bi-ViT)仍基本未被探索且是一项极具挑战的任务,因其性能难以接受。通过大量实证分析,我们确定 ViT 二值化中的严重性能下降是由自注意力中的注意力失真引起,技术上源于梯度消失与排序紊乱。为解决这些问题,我们首先引入可学习缩放因子以重新激活消失的梯度,并通过理论与实验分析阐明其有效性。随后我们提出排序感知蒸馏方法,在师生框架中纠正紊乱的排序。Bi-ViT 在 Top-1 准确率和 FLOPs 方面相较流行的 DeiT 和 Swin 骨干网络取得显著改进。例如,使用 DeiT-Tiny 和 Swin-Tiny,我们的方法分别显著优于基线 22.1% 和 21.4%,同时在 ImageNet 上相较实值对应网络有 61.5 倍和 56.1 倍的理论 FLOPs 加速。
引用
@article{arxiv.2305.12354,
title = {Bi-ViT: Pushing the Limit of Vision Transformer Quantization},
author = {Yanjing Li and Sheng Xu and Mingbao Lin and Xianbin Cao and Chuanjian Liu and Xiao Sun and Baochang Zhang},
journal= {arXiv preprint arXiv:2305.12354},
year = {2023}
}