中文

MPViT:用于密集预测的多路径视觉 Transformer

计算机视觉与模式识别 2021-12-28 v2

摘要

目标检测与分割等密集计算机视觉任务需要有效的多尺度特征表示,以检测或分类尺寸各异的物体或区域。尽管卷积神经网络(CNNs)一直是此类任务的主导架构,但近期引入的视觉 Transformer(ViTs)旨在作为骨干网络取代它们。与 CNNs 类似,ViTs 构建了简单的多阶段结构(即细到粗),以单尺度图像块进行多尺度表示。在本文中,不同于现有 Transformer 的视角,我们探索多尺度图像块嵌入与多路径结构,构建了多路径视觉 Transformer(MPViT)。MPViT 通过使用重叠卷积图像块嵌入,同时以不同尺度的图像块嵌入相同尺寸(即序列长度)的特征。不同尺度的 token 随后通过多条路径独立送入 Transformer 编码器,并将所得特征聚合,从而在同一特征层级上实现细粒度与粗粒度特征表示。得益于多样的多尺度特征表示,我们的 MPViT 从 tiny(5M)到 base(73M)的缩放版本在 ImageNet 分类、目标检测、实例分割和语义分割上始终优于最先进的视觉 Transformer。这些广泛的结果表明,MPViT 可作为各种视觉任务的多功能骨干网络。代码将公开于 \url{https://git.io/MPViT}。

关键词

引用

@article{arxiv.2112.11010,
  title  = {MPViT: Multi-Path Vision Transformer for Dense Prediction},
  author = {Youngwan Lee and Jonghee Kim and Jeff Willette and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2112.11010},
  year   = {2021}
}

备注

technical report