中文

SparseSwin:带稀疏Transformer块的Swin Transformer

计算机视觉与模式识别 2024-03-08 v1 人工智能 机器学习

摘要

计算机视觉研究的进展已使 transformer 架构成为视觉任务中的最优方法。transformer 架构一个已知的缺点是参数量大,这可能导致算法更复杂且低效。本文旨在减少参数量,进而使 transformer 更高效。我们提出稀疏 Transformer (SparTa) 块,一种修改后的 transformer 块,增加了可减少所用 token 数量的稀疏 token 转换器。我们将 SparTa 块置于 Swin T 架构内(SparseSwin),以利用 Swin 对输入下采样从而减少待计算初始 token 数的能力。所提 SparseSwin 模型在图像分类上优于其他 SOTA 模型,在 ImageNet100、CIFAR10 和 CIFAR100 数据集上准确率分别为 86.96%、97.43% 和 85.35%。尽管参数更少,结果突显了使用稀疏 token 转换器与有限 token 数量的 transformer 架构在优化 transformer 使用并提升性能方面的潜力。

关键词

引用

@article{arxiv.2309.05224,
  title  = {SparseSwin: Swin Transformer with Sparse Transformer Block},
  author = {Krisna Pinasthika and Blessius Sheldo Putra Laksono and Riyandi Banovbi Putera Irsal and Syifa Hukma Shabiyya and Novanto Yudistira},
  journal= {arXiv preprint arXiv:2309.05224},
  year   = {2024}
}