中文

散射视觉 Transformer:频谱混合至关重要

计算机视觉与模式识别 2023-11-21 v2 人工智能 机器学习 图像与视频处理 信号处理

摘要

视觉 Transformer 已在包括图像分类、实例分割和物体检测在内的各种计算机视觉任务中获得显著关注并达到最先进性能。然而,在解决注意力复杂度和有效捕获图像内细粒度信息方面仍存在挑战。现有方案常诉诸下采样操作(如池化)以降低计算成本。不幸的是,此类操作不可逆并可能导致信息丢失。在本文中,我们提出一种称为散射视觉 Transformer(SVT)的新颖方法来应对这些挑战。SVT 引入了频谱散射网络,能够捕获精细图像细节。SVT 通过分离低频与高频分量,克服了与下采样操作相关的不可逆问题。此外,SVT 引入了一种独特的频谱门控网络,利用爱因斯坦乘法进行令牌与通道混合,有效降低复杂度。我们表明 SVT 在 ImageNet 数据集上以参数数量和 FLOPS 的显著减少实现了最先进性能。SVT 较 LiTv2 和 iFormer 提升 2%。SVT-H-S 达到 84.2% 的 top-1 准确率,而 SVT-H-B 达到 85.2%(基础版本中最先进),SVT-H-L 达到 85.7%(再次为大型版本中最先进)。SVT 在实例分割等其他视觉任务中也显示出可比结果。SVT 在标准数据集(如 CIFAR10、CIFAR100、Oxford Flower 和 Stanford Car 数据集)的迁移学习中也优于其他 Transformer。项目页面可在此网页查看。\url{https://badripatro.github.io/svt/}。

关键词

引用

@article{arxiv.2311.01310,
  title  = {Scattering Vision Transformer: Spectral Mixing Matters},
  author = {Badri N. Patro and Vijay Srinivas Agneeswaran},
  journal= {arXiv preprint arXiv:2311.01310},
  year   = {2023}
}

备注

Accepted @NeurIPS 2023