CageViT:卷积激活引导的高效视觉 Transformer
计算机视觉与模式识别
2023-05-18 v1
摘要
近来,Transformers 已成为视觉与语言建模任务的首选架构,但其计算效率受输入序列长度限制。为此,已有若干高效 Transformer 变体被提出,以在保持性能的同时加速计算或降低内存消耗。本文提出一种称为 CageViT 的高效视觉 Transformer,其由卷积激活引导以减少计算。与当前 Transformer 不同,我们的 CageViT 利用新编码器处理重排后的 token,带来若干技术贡献:1)在图像分块后使用卷积激活对 token 进行预处理,以筛选并重排主要 token 与次要 token,并通过额外的融合层大幅降低计算成本。2)不同于直接使用卷积模型的类激活图,我们设计了一种新的加权类激活以降低模型要求。3)为促进主要 token 与融合 token 之间的通信,提出 Gated Linear SRA 将融合 token 进一步整合进注意力机制。我们在图像分类任务上对 CageViT 进行了全面验证。实验结果表明,所提 CageViT 在效率上大幅优于近期最先进的骨干网络,同时保持可比的精度水平(例如,仅在 224 x 224 ImageNet-1K 上训练的 43.35M 中等规模模型可达到 83.4% 的 Top-1 准确率)。
引用
@article{arxiv.2305.09924,
title = {CageViT: Convolutional Activation Guided Efficient Vision Transformer},
author = {Hao Zheng and Jinbao Wang and Xiantong Zhen and Hong Chen and Jingkuan Song and Feng Zheng},
journal= {arXiv preprint arXiv:2305.09924},
year = {2023}
}
备注
9 pages, 3 figures, NeurIPS conference