中文

CAS-ViT:用于高效移动应用的卷积可加自注意力视觉变换器

计算机视觉与模式识别 2024-12-16 v2

摘要

视觉变换器 (ViT) 以其强大的全局上下文能力在神经网络中标志着一种革命性进展。然而,成对 token 的亲和性和复杂的矩阵运算限制了其在资源受限场景和实时应用中的部署,例如移动设备,尽管已有大量工作致力于此。在本文中,我们引入了 CAS-ViT:卷积可加自注意力视觉变换器,以在移动应用中实现效率与性能之间的平衡。首先,我们认为,token 混合器获取全局上下文信息的能力依赖于多次信息交互,例如空间和通道域。随后,我们提出了卷积可加 token 混合器 (CATM),采用底层空间和通道注意力作为新的交互形式。该模块消除了矩阵乘法和 Softmax 等繁琐的复杂运算。我们引入卷积可加自注意力 (CAS) 框架的混合架构,并使用 CATM 作为每个模块。进一步,我们构建了一个轻量级网络家族,可轻松扩展到各种下游任务。最后,我们在包括图像分类、目标检测、实例分割和语义分割在内的多种视觉任务上评估了 CAS-ViT。我们的 M 和 T 模型在 ImageNet-1K 上分别仅使用 12M/21M 参数即可实现 83.0%/84.1% 的 Top-1 准确率。同时,在 GPU、ONNX 和 iPhone 上的吞吐量评估也表明其优于其他最先进的主干网络。广泛的实验表明,我们的方法在性能、高效推理和易于部署之间实现了更好的平衡。我们的 code 和模型已提供:\url{https://github.com/Tianfang-Zhang/CAS-ViT}。

关键词

引用

@article{arxiv.2408.03703,
  title  = {CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications},
  author = {Tianfang Zhang and Lei Li and Yang Zhou and Wentao Liu and Chen Qian and Jenq-Neng Hwang and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2408.03703},
  year   = {2024}
}