中文

自适应分割融合Transformer

计算机视觉与模式识别 2023-08-17 v2

摘要

用于视觉内容理解的神经网络近来已从卷积网络(CNN)演进至 Transformer。前者(CNN)依赖小窗口核捕捉区域线索,展现出扎实的局部表达能力。相反,后者(Transformer)在局部间建立长程全局连接以实现整体学习。受此互补特性启发,设计混合模型以最佳利用各项技术的兴趣日益增长。当前混合模型仅将卷积简单近似为线性投影或把卷积分支与注意力并列,而未关注局部/全局建模的重要性。为此,我们提出一种名为自适应分割融合 Transformer(ASF-former)的新混合模型,以自适应权重差异化对待卷积与注意力分支。具体而言,ASF-former 编码器将特征通道均等拆分为两半以适配双路径输入。随后,双路径输出通过由视觉线索计算出的加权标量进行融合。我们还紧凑地设计了卷积路径以兼顾效率。在 ImageNet-1K、CIFAR-10 与 CIFAR-100 等标准基准上的大量实验表明,在相似条件(12.9G MACs/56.7M Params,无大规模预训练)下,我们的 ASF-former 在准确率(ImageNet-1K 上 83.9%)上优于其 CNN、Transformer 对应模型及混合基线。代码见:https://github.com/szx503045266/ASF-former。

关键词

引用

@article{arxiv.2204.12196,
  title  = {Adaptive Split-Fusion Transformer},
  author = {Zixuan Su and Hao Zhang and Jingjing Chen and Lei Pang and Chong-Wah Ngo and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2204.12196},
  year   = {2023}
}