中文

SCSC:增强 CNN 与 Transformer 的空间跨尺度卷积模块

计算机视觉与模式识别 2023-08-15 v1

摘要

本文提出一个模块——空间跨尺度卷积(SCSC),经验证其在改进 CNN 和 Transformer 方面均有效。如今,CNN 和 Transformer 已在多种任务中取得成功。尤其是 Transformer,越来越多的工作在计算机视觉领域取得了最先进(SOTA)性能。因此,研究者开始探索这些架构的机制。大感受野、稀疏连接、权值共享和动态权值已被视为设计有效基础模型的关键。然而,仍有一些问题有待解决:大密集卷积核与自注意力效率低,且大感受野难以捕获局部特征。受上述分析启发并为解决所提问题,本文设计一个通用模块,采纳这些设计关键以同时增强 CNN 和 Transformer。SCSC 引入高效的空间跨尺度编码器和空间嵌入模块,在单层内捕获多样特征。在人脸识别任务上,带 SCSC 的 FaceResNet 以少 68% 的 FLOPs 和少 79% 的参数提升 2.7%。在 ImageNet 分类任务上,带 SCSC 的 Swin Transformer 以少 22% 的 FLOPs 取得更优性能,而带 CSCS 的 ResNet 以相近复杂度提升 5.3%。此外,嵌入 SCSC 的传统网络(如 ResNet)可匹敌 Swin Transformer 的性能。

关键词

引用

@article{arxiv.2308.07110,
  title  = {SCSC: Spatial Cross-scale Convolution Module to Strengthen both CNNs and Transformers},
  author = {Xijun Wang and Xiaojie Chu and Chunrui Han and Xiangyu Zhang},
  journal= {arXiv preprint arXiv:2308.07110},
  year   = {2023}
}

备注

ICCV2023 Workshop (New Ideas in Vision Transformers)