具有交叉特征注意力的轻量级视觉Transformer
计算机视觉与模式识别
2023-07-06 v2
摘要
视觉Transformer(ViTs)的最新进展在视觉识别任务中取得了优异性能。卷积神经网络(CNNs)利用空间归纳偏置来学习视觉表征,但这些网络在空间上是局部的。ViTs可通过自注意力机制学习全局表征,但它们通常重量级且不适合移动设备。本文提出交叉特征注意力(XFA)以降低Transformer的计算成本,并结合高效的移动端CNNs构成一种新颖的高效轻量级CNN-ViT混合模型XFormer,可作为学习全局与局部表征的通用骨干网络。实验结果表明,XFormer在不同任务和数据集上优于众多基于CNN和ViT的模型。在ImageNet1K数据集上,XFormer以550万参数实现了78.5%的top-1准确率,在参数量相近的情况下比EfficientNet-B0(基于CNN)和DeiT(基于ViT)分别高出2.2%和6.3%。我们的模型在迁移到目标检测和语义分割任务时同样表现良好。在MS COCO数据集上,XFormer在YOLOv3框架下以仅6.3M参数和3.8G FLOPs超越MobileNetV2达10.5 AP(22.7 -> 33.2 AP)。在Cityscapes数据集上,仅使用一个简单的全MLP解码器,XFormer即取得78.5的mIoU和15.3的FPS,超越了最先进的轻量级分割网络。
引用
@article{arxiv.2207.07268,
title = {Lightweight Vision Transformer with Cross Feature Attention},
author = {Youpeng Zhao and Huadong Tang and Yingying Jiang and Yong A and Qiang Wu},
journal= {arXiv preprint arXiv:2207.07268},
year = {2023}
}
备注
Technical Report. A shorter version has been accepted to ICIP 2023