DualToken-ViT:基于双令牌融合的位置感知高效视觉Transformer
计算机视觉与模式识别
2023-09-25 v1
摘要
基于自注意力的视觉Transformer(ViT)已成为计算机视觉中极具竞争力的架构。与卷积神经网络(CNN)不同,ViT 能够进行全局信息交互。随着各类 ViT 结构的发展,ViT 在许多视觉任务中愈发具有优势。然而,自注意力的二次复杂度使 ViT 计算密集,且其对局部性和平移等变性的归纳偏置缺失,相较于 CNN 需要更大的模型规模才能有效学习视觉特征。本文提出一种轻量高效的视觉Transformer模型 DualToken-ViT,它利用了 CNN 与 ViT 的优势。DualToken-ViT 有效融合了由基于卷积的结构获得的带局部信息的令牌与由基于自注意力的结构获得的带全局信息的令牌,从而实现高效的注意力结构。此外,我们在所有阶段使用位置感知全局令牌来丰富全局信息,进一步强化 DualToken-ViT 的效果。位置感知全局令牌还包含图像的位置信息,使我们的模型更适用于视觉任务。我们在图像分类、目标检测和语义分割任务上进行了大量实验以证明 DualToken-ViT 的有效性。在 ImageNet-1K 数据集上,我们不同规模的模型仅以 0.5G 和 1.0G FLOPs 分别达到 75.4% 和 79.4% 的准确率,且我们 1.0G FLOPs 的模型比使用全局令牌的 LightViT-T 高出 0.7%。
引用
@article{arxiv.2309.12424,
title = {DualToken-ViT: Position-aware Efficient Vision Transformer with Dual Token Fusion},
author = {Zhenzhen Chu and Jiayu Chen and Cen Chen and Chengyu Wang and Ziheng Wu and Jun Huang and Weining Qian},
journal= {arXiv preprint arXiv:2309.12424},
year = {2023}
}