中文

ViTAE:通过探索内在归纳偏置改进的视觉Transformer

计算机视觉与模式识别 2021-12-28 v4

摘要

Transformer 凭借其利用自注意力机制建模长程依赖的强大能力,在各种计算机视觉任务中展现出巨大潜力。然而,视觉 Transformer 将图像视为视觉 token 的一维序列,缺乏建模局部视觉结构和处理尺度变化的内在归纳偏置(IB)。作为替代,它们需要大规模训练数据和更长的训练周期来隐式地学习 IB。本文中,我们提出一种通过从卷积中探索内在 IB 改进的新型视觉 Transformer,即 ViTAE。从技术上讲,ViTAE 具有若干空间金字塔缩减模块,通过使用具有不同膨胀率的多个卷积对输入图像进行下采样并嵌入为具有丰富多尺度上下文的 token。以此方式,它获得了内在的尺度不变性 IB,并能够为不同尺度的物体学习鲁棒的特征表示。此外,在每个 Transformer 层中,ViTAE 有一个与多头自注意力模块并行运行的卷积块,其特征被融合后送入前馈网络。因此,它具有内在的局部性 IB,并能够协同地学习局部特征与全局依赖。在 ImageNet 及下游任务上的实验证明了 ViTAE 相对于基线 Transformer 和同期工作的优越性。源代码与预训练模型将在 GitHub 上提供。

关键词

引用

@article{arxiv.2106.03348,
  title  = {ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias},
  author = {Yufei Xu and Qiming Zhang and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2106.03348},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021, 23 pages, including downstream task results (detection, semantic segmentation, human pose, and video object segmentation)