中文

MOAT:移动卷积与注意力交替带来强视觉模型

计算机视觉与模式识别 2023-02-01 v2

摘要

本文提出 MOAT,一系列构建于 MObile 卷积(即倒置残差块)和 ATtention 之上的神经网络。与当前堆叠独立移动卷积和 transformer 块的工作不同,我们将其有效合并为一个 MOAT 块。从标准 Transformer 块出发,我们将其多层感知机替换为移动卷积块,并进一步将其重排至自注意力操作之前。移动卷积块不仅增强了网络表征能力,还产生更好的下采样特征。我们概念上简单的 MOAT 网络出奇地有效,在 ImageNet-1K / ImageNet-1K-V2 上借助 ImageNet22K 预训练取得了 89.1% / 81.5% 的 top-1 准确率。此外,MOAT 可通过将全局注意力转换为窗口注意力,无缝应用于需要大分辨率输入的下游任务。得益于有效交换像素间(从而跨窗口)局部信息的移动卷积,MOAT 不需要额外的窗口移位机制。结果,在 COCO 目标检测上,MOAT 以 227M 模型参数(单尺度推理,硬 NMS)取得 59.2% 框 AP;在 ADE20K 语义分割上,MOAT 以 496M 模型参数(单尺度推理)获得 57.6% mIoU。最后,通过简单缩小通道尺寸获得的 tiny-MOAT 系列,在 ImageNet 上也出奇地优于若干面向移动的基于 transformer 的模型。tiny-MOAT 系列也在下游任务上进行了基准测试,作为社区基线。我们希望这个简单而有效的 MOAT 能启发更多卷积与自注意力的无缝集成。代码已公开可用。

关键词

引用

@article{arxiv.2210.01820,
  title  = {MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models},
  author = {Chenglin Yang and Siyuan Qiao and Qihang Yu and Xiaoding Yuan and Yukun Zhu and Alan Yuille and Hartwig Adam and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2210.01820},
  year   = {2023}
}

备注

ICLR 2023. arXiv v2: add ImageNet-1K-V2, tiny-MOAT on COCO detection and ADE20K segmentation