BiViT:极度压缩的二值视觉Transformer
计算机视觉与模式识别
2023-10-06 v2 人工智能
摘要
模型二值化可通过高效按位运算显著压缩模型尺寸、降低能耗并加速推断。尽管卷积神经网络的二值化已被广泛研究,探索视觉Transformer(其支撑了近期视觉识别的大部分突破)的二值化工作甚少。为此,我们提出解决两个基本挑战以推进二值视觉Transformer(BiViT)的边界。第一,传统二值方法未考虑softmax注意力的长尾分布,在注意力模块中带来较大二值化误差。为此,我们提出Softmax感知二值化,其动态适配数据分布并降低二值化引起的误差。第二,为更好保留预训练模型信息并恢复精度,我们提出跨层二值化方案,解耦自注意力与多层感知机(MLPs)的二值化,以及参数化权重量级,其为权值二值化引入可学习的缩放因子。总体上,我们的方法在TinyImageNet数据集上以19.8%优于SOTA。在ImageNet上,我们的BiViT相较Swin-S模型取得具竞争力的75.6% Top-1精度。此外,在COCO目标检测上,我们的方法以Swin-T为骨干在Cascade Mask R-CNN框架下取得40.8的mAP。
引用
@article{arxiv.2211.07091,
title = {BiViT: Extremely Compressed Binary Vision Transformer},
author = {Yefei He and Zhenyu Lou and Luoming Zhang and Jing Liu and Weijia Wu and Hong Zhou and Bohan Zhuang},
journal= {arXiv preprint arXiv:2211.07091},
year = {2023}
}
备注
Accepted by ICCV 2023