MaxViT:多轴视觉Transformer
摘要
Transformer 近期在计算机视觉领域获得了显著关注。然而,自注意力机制相对于图像尺寸缺乏可扩展性,限制了其在最先进视觉骨干网络中的广泛采用。本文中,我们提出一种高效且可扩展的注意力模型,称为多轴注意力(multi-axis attention),它包含两个方面:分块局部注意力与膨胀全局注意力。这些设计选择使得在任意输入分辨率上以仅线性复杂度实现全局-局部空间交互成为可能。我们还通过有效地将所提注意力模型与卷积相融合,提出了一种新的架构元素,并相应地通过简单地在多阶段上重复基本构建块,提出了一个简洁的分层视觉骨干网络,称为 MaxViT。值得注意的是,MaxViT 能够在整个网络中“看到”全局,即使在早期的高分辨率阶段也是如此。我们展示了我们的模型在广泛视觉任务上的有效性。在图像分类上,MaxViT 在各种设置下均达到最先进性能:在无额外数据时,MaxViT 取得 86.5% 的 ImageNet-1K top-1 准确率;在 ImageNet-21K 预训练下,我们的模型达到 88.7% 的 top-1 准确率。对于下游任务,MaxViT 作为骨干网络在目标检测以及视觉美学评估上均提供了良好的性能。我们还展示了所提模型在 ImageNet 上表现出强大的生成建模能力,证明了 MaxViT 块作为通用视觉模块的优越潜力。源代码与训练模型将发布于 https://github.com/google-research/maxvit。
引用
@article{arxiv.2204.01697,
title = {MaxViT: Multi-Axis Vision Transformer},
author = {Zhengzhong Tu and Hossein Talebi and Han Zhang and Feng Yang and Peyman Milanfar and Alan Bovik and Yinxiao Li},
journal= {arXiv preprint arXiv:2204.01697},
year = {2022}
}
备注
ECCV 2022; code: https://github.com/google-research/maxvit v1: initials; v2: added GAN visuals; v3: fixed ImageNet-1k acc typos for Maxvit @ 384