中文

DilateFormer:面向视觉识别的多尺度空洞Transformer

计算机视觉与模式识别 2023-02-09 v1

摘要

作为事实上的标准解决方案,原始视觉Transformer(ViTs)被鼓励对任意图像块之间的长程依赖关系进行建模,然而全局的感受野导致了平方级的计算代价。另一类视觉Transformer则利用受CNN启发的局部注意力机制,仅对小邻域内的块间交互进行建模。尽管这种方案降低了计算代价,但它天然地受限于较小的感受野,可能限制性能。本文探索高效的视觉Transformer,以在计算复杂度和感受野大小之间寻求更优的权衡。通过分析ViTs中全局注意力的块交互,我们观察到浅层中的两个关键特性,即局部性和稀疏性,这表明ViTs浅层的全局依赖建模存在冗余。据此,我们提出多尺度空洞注意力(MSDA),在滑动窗口内对局部和稀疏的块交互进行建模。采用金字塔架构,我们通过在低级阶段堆叠MSDA模块、在高级阶段堆叠全局多头自注意力模块,构建了多尺度空洞Transformer(DilateFormer)。实验结果表明,DilateFormer在多种视觉任务上达到了最先进的性能。在ImageNet-1K分类任务上,与现有最先进模型相比,DilateFormer以少70%的FLOPs实现了可比的性能。DilateFormer-Base在ImageNet-1K分类任务上达到85.6%的top-1准确率,在COCO目标检测/实例分割任务上达到53.5% box mAP/46.1% mask mAP,在ADE20K语义分割任务上达到51.1% MS mIoU。

关键词

引用

@article{arxiv.2302.01791,
  title  = {DilateFormer: Multi-Scale Dilated Transformer for Visual Recognition},
  author = {Jiayu Jiao and Yu-Ming Tang and Kun-Yu Lin and Yipeng Gao and Jinhua Ma and Yaowei Wang and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2302.01791},
  year   = {2023}
}

备注

Accepted to IEEE Transaction on Multimedia, 2023 (Submission date: 22-Sep-2022)