中文

CTRL-F: 通过多级特征交叉注意力与表示学习融合将卷积与 Transformer 用于图像分类

计算机视觉与模式识别 2025-08-26 v2

摘要

Transformer 在计算机视觉领域因其巨大的容量和全局处理能力而受到广泛关注。然而,Transformer 数据需求大,其泛化能力受限于缺乏 ConvNets 所具备的内置空间归纳偏置。本文旨在最优组合卷积和 Transformer 的优势,用于图像分类任务。为此,我们提出了一种新型轻量级混合网络,通过表示学习融合和多级特征交叉注意力将卷积与 Transformer 配对,命名为 CTRL-F。我们的网络包含一个卷积分支和一个名为多级特征交叉注意力(MFCA)的新型 Transformer 模块。MFCA 模块 operates on 来自不同卷积阶段获得的多级特征表示。它通过两个独立的 Transformer 分支处理来自这些多级特征表示的小 patch token 和大 patch token,其中两个分支通过交叉注意力机制进行通信和知识交换。我们采用新颖的表示融合技术,将卷积路径获取的局部响应与 MFCA 模块获取的全局响应融合,称为自适应知识融合(AKF)和协作知识融合(CKF)。实验表明,我们的 CTRL-F 变体在从头训练大数据或即使在低数据情景下,也达到了最先进的性能。例如,CTR-L-F 在在 Oxford-102 Flowers 和 PlantVillage 数据集上从头训练时,分别实现了 82.24% 和 99.91% 的 top-1 准确率,超越了展示其在图像分类任务中鲁棒性的最先进模型。代码地址: https://github.com/hosamsherif/CTRL-F

关键词

引用

@article{arxiv.2407.06673,
  title  = {CTRL-F: Pairing Convolution with Transformer for Image Classification via Multi-Level Feature Cross-Attention and Representation Learning Fusion},
  author = {Hosam S. EL-Assiouti and Hadeer El-Saadawy and Maryam N. Al-Berry and Mohamed F. Tolba},
  journal= {arXiv preprint arXiv:2407.06673},
  year   = {2025}
}