LightViT:面向轻量无卷积视觉 Transformer
计算机视觉与模式识别
2022-07-13 v1 人工智能
机器学习
摘要
视觉 Transformer(ViT)通常被认为由于缺少归纳偏置而比卷积神经网络(CNN)更不轻量。近期工作因而求助于卷积作为即插即用模块并将其嵌入各类 ViT 变体中。本文中,我们认为卷积核执行信息聚合以连接所有 token;然而,若这种显式聚合能以更同质的方式发挥作用,则对于轻量 ViT 而言它们实际上并非必要。受此启发,我们提出 LightViT 作为一个轻量 ViT 新系列,在纯 Transformer 模块上实现更好的精度-效率平衡且无需卷积。具体而言,我们在 ViT 的自注意力和前馈网络(FFN)中引入一种全局且高效的聚合方案,其中引入额外的可学习 token 以捕获全局依赖;并对 token 嵌入施加双维通道与空间注意力。实验表明,我们的模型在图像分类、目标检测和语义分割任务上取得了显著改进。例如,我们的 LightViT-T 在 ImageNet 上以仅 0.7G FLOPs 达到 78.7% 准确率,优于 PVTv2-B0 达 8.2%,同时在 GPU 上快 11%。代码见 https://github.com/hunto/LightViT。
引用
@article{arxiv.2207.05557,
title = {LightViT: Towards Light-Weight Convolution-Free Vision Transformers},
author = {Tao Huang and Lang Huang and Shan You and Fei Wang and Chen Qian and Chang Xu},
journal= {arXiv preprint arXiv:2207.05557},
year = {2022}
}
备注
13 pages, 7 figures, 9 tables