中文

CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision

计算机视觉与模式识别 2025-09-12 v1

摘要

Vision Transformer (ViT) 通过利用自注意力机制来建模长程依赖,在计算机视觉中取得了令人印象深刻的结果。然而,其对全局语境的强调往往以牺牲小数据集上局部特征提取为代价,尤其是由于缺乏如局部性和平移等价性等关键归纳偏置。为缓解这一问题,我们提出了 CoSwin,这是一种新的特征融合架构,通过局部卷积特征学习来增强分层位移窗口注意力。具体而言,CoSwin 将可学习的局部特征增强模块集成到每个注意力块中,使模型能够同时捕获细粒度空间细节和全局语义结构。我们在多个图像分类基准测试上评估了 CoSwin,包括 CIFAR-10、CIFAR-100、MNIST、SVHN 和 Tiny ImageNet。我们的实验结果显示,CoSwin 在 state-of-the-art 卷积和基于 Transformer 的模型上 consistently 实现性能提升。值得注意的是,CoSwin 在 CIFAR-10 上提升 2.17%、在 CIFAR-100 上提升 4.92%、在 MNIST 上提升 0.10%、在 SVHN 上提升 0.26%、在 Tiny ImageNet 上提升 4.47%,超过基线 Swin Transformer。这些改进凸显了在小规模视觉任务中通过局部-全局特征融合来增强 Transformer 泛化和鲁棒性的有效性。代码和预训练权重可在 https://github.com/puskal-khadka/coswin 获取。

关键词

引用

@article{arxiv.2509.08959,
  title  = {CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision},
  author = {Puskal Khadka and Rodrigue Rizk and Longwei Wang and KC Santosh},
  journal= {arXiv preprint arXiv:2509.08959},
  year   = {2025}
}