中文

一种轻量级卷积与Vision Transformer集成模型,具多尺度自注意力机制

计算机视觉与模式识别 2025-09-12 v2 神经与进化计算

摘要

Vision Transformer (ViT) 因其强大的长程依赖建模能力在计算机视觉任务中占据上风。然而,其大型模型规模和较弱的局部特征建模能力限制了在实际场景中的应用。为在下游视觉任务中平衡计算效率与性能,我们提出一种高效ViT模型(称为SAEViT),集成稀疏注意力与卷积块。具体而言,提出Sparsely Aggregated Attention (SAA) 模块,通过稀疏采样和反卷积操作恢复特征图,从而显著降低注意力操作的计算复杂度。此外,开发Channel-Interactive Feed-Forward Network (CIFFN) 层,通过特征分解与重分配增强通道间信息交互,缓解传统前馈网络(FFN)中的冗余。最后,设计层次化金字塔结构嵌入深度可分离卷积块(DWSConv),进一步强化卷积特征。在ImageNet-1K分类任务上,SAEViT的Top-1准确率分别为76.3%和79.6%,仅需0.8和1.3个GFLOPs,展示了面向基础视觉任务的轻量级解决方案。

关键词

引用

@article{arxiv.2508.16884,
  title  = {A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism},
  author = {Yi Zhang and Lingxiao Wei and Bowei Zhang and Ziwei Liu and Kai Yi and Shu Hu},
  journal= {arXiv preprint arXiv:2508.16884},
  year   = {2025}
}