中文

SpectFormer:视觉 Transformer 所需的是频率与注意力

计算机视觉与模式识别 2023-04-18 v2 人工智能 计算与语言 机器学习

摘要

视觉 Transformer 已成功应用于图像识别任务。已有工作或是基于多头自注意力(ViT \cite{dosovitskiy2020image}、DeIT \cite{touvron2021training}),类似于文本模型中的原始工作,或是更近期基于谱层(Fnet\cite{lee2021fnet}、GFNet\cite{rao2021global}、AFNO\cite{guibas2021efficient})。我们假设谱与多头注意力均发挥主要作用。我们通过本工作验证该假设,并观察到结合谱层与多头注意力层确实提供了更优的 Transformer 架构。因此我们提出结合谱层与多头注意力层的新型 Spectformer 架构。我们相信所得表示使 Transformer 能恰当捕获特征表示,并相较其他 Transformer 表示取得更优性能。例如,在 ImageNet 上其 top-1 准确率较 GFNet-H 与 LiT 均提升 2%。SpectFormer-S 在 ImageNet-1K 上达到 84.25% top-1 准确率(小版本中的 state of the art)。此外,Spectformer-L 取得 85.7%,是可比较 base 版本 Transformer 中的 state of the art。我们进一步确保在其他场景如 CIFAR-10、CIFAR-100、Oxford-IIIT-flower 与 Standford Car 数据集上的迁移学习中获得合理结果。我们随后考察其在 MS-COCO 数据集上目标检测与实例分割等下游任务中的使用,并观察到 Spectformer 展现出可与最佳骨干网络相媲美且可进一步优化提升的一致性能。因此,我们相信结合的谱层与注意力层正是视觉 Transformer 之所需。

关键词

引用

@article{arxiv.2304.06446,
  title  = {SpectFormer: Frequency and Attention is what you need in a Vision Transformer},
  author = {Badri N. Patro and Vinay P. Namboodiri and Vijay Srinivas Agneeswaran},
  journal= {arXiv preprint arXiv:2304.06446},
  year   = {2023}
}

备注

The project page is available at this webpage \url{https://badripatro.github.io/SpectFormers/}