CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision
计算机视觉与模式识别
2025-09-12 v1
摘要
Vision Transformer (ViT) 通过利用自注意力机制来建模长程依赖,在计算机视觉中取得了令人印象深刻的结果。然而,其对全局语境的强调往往以牺牲小数据集上局部特征提取为代价,尤其是由于缺乏如局部性和平移等价性等关键归纳偏置。为缓解这一问题,我们提出了 CoSwin,这是一种新的特征融合架构,通过局部卷积特征学习来增强分层位移窗口注意力。具体而言,CoSwin 将可学习的局部特征增强模块集成到每个注意力块中,使模型能够同时捕获细粒度空间细节和全局语义结构。我们在多个图像分类基准测试上评估了 CoSwin,包括 CIFAR-10、CIFAR-100、MNIST、SVHN 和 Tiny ImageNet。我们的实验结果显示,CoSwin 在 state-of-the-art 卷积和基于 Transformer 的模型上 consistently 实现性能提升。值得注意的是,CoSwin 在 CIFAR-10 上提升 2.17%、在 CIFAR-100 上提升 4.92%、在 MNIST 上提升 0.10%、在 SVHN 上提升 0.26%、在 Tiny ImageNet 上提升 4.47%,超过基线 Swin Transformer。这些改进凸显了在小规模视觉任务中通过局部-全局特征融合来增强 Transformer 泛化和鲁棒性的有效性。代码和预训练权重可在 https://github.com/puskal-khadka/coswin 获取。
引用
@article{arxiv.2509.08959,
title = {CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision},
author = {Puskal Khadka and Rodrigue Rizk and Longwei Wang and KC Santosh},
journal= {arXiv preprint arXiv:2509.08959},
year = {2025}
}