BinaryViT:将二值视觉 Transformer 推向卷积模型
计算机视觉与模式识别
2023-07-04 v1 机器学习
摘要
随着视觉 Transformer(ViT)的日益流行与规模增大,人们越来越关注使其在计算资源受限的边缘设备上部署时更高效、计算成本更低。二值化可用于显著减小 ViT 模型规模与计算成本,在权重与激活均为二值时使用 popcount 运算。然而,与在 ImageNet-1k 等具有大量类别的数据集上的 CNN 相比,直接将 CNN 二值化方法或现有二值化方法应用于 ViT 进行二值化时,ViT 的性能下降比 CNN 更大。通过大量分析,我们发现二值化原始 ViT(如 DeiT)缺失了许多 CNN 具备的关键架构特性,这些特性使二值 CNN 比二值原始 ViT 具有更高的表示能力。因此,我们提出 BinaryViT,其受 CNN 架构启发,在纯 ViT 架构中引入 CNN 架构的操作,以在不引入卷积的情况下丰富二值 ViT 的表示能力。这些操作包括用平均池化层替代 token 池化层、包含多平均池化分支的块、在每个主残差连接相加前的仿射变换,以及金字塔结构。在 ImageNet-1k 数据集上的实验结果表明,这些操作使二值纯 ViT 模型能与先前最先进(SOTA)的二值 CNN 模型相竞争。
引用
@article{arxiv.2306.16678,
title = {BinaryViT: Pushing Binary Vision Transformers Towards Convolutional Models},
author = {Phuoc-Hoan Charles Le and Xinlin Li},
journal= {arXiv preprint arXiv:2306.16678},
year = {2023}
}
备注
Accepted in CVPR 2023 Workshop on Efficient Deep Learning for Computer Vision (ECV)