中文

ViTAEv2:通过探索归纳偏置改进视觉Transformer用于图像识别及更多任务

计算机视觉与模式识别 2022-11-29 v2

摘要

视觉Transformer凭借利用自注意力机制建模长程依赖的强大能力,在各种计算机视觉任务中展现出巨大潜力。然而,它们将图像视为视觉token的一维序列,缺乏建模局部视觉结构和处理尺度变化的内在归纳偏置(IB),而是从大规模训练数据和更长训练计划中隐式学习。本文中,我们提出一种通过从卷积中探索内在IB来改进的视觉Transformer,即 ViTAE。从技术上讲,ViTAE 具有若干空间金字塔缩减模块,利用不同膨胀率的多个卷积对输入图像进行下采样并嵌入为具有丰富多尺度上下文的token。以此方式,它获得了内在的尺度不变性IB,并能为不同尺度的对象学习鲁棒的特征表示。此外,在每个Transformer层中,ViTAE 有一个与多头自注意力模块并行的卷积块,其特征被融合并送入前馈网络。因此,它具有内在的局部性IB,能够协同学习局部特征和全局依赖。所提出的两种单元以各向同性和多阶段方式堆叠,形成两个系列的 ViTAE 模型,即原始 ViTAE 和 ViTAEv2。在 ImageNet 数据集以及 MS COCO、ADE20K 和 AP10K 数据集上的下游任务实验验证了我们的模型相对于基线Transformer模型和同期工作的优越性。此外,我们将 ViTAE 模型扩展到 644M 参数,获得了最先进的分类性能,即在 ImageNet 验证集上 88.5% 的 Top-1 分类准确率,以及在 ImageNet 真实验证集上最佳的 91.2% Top-1 准确率,且未使用额外的私有数据。

关键词

引用

@article{arxiv.2202.10108,
  title  = {ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond},
  author = {Qiming Zhang and Yufei Xu and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2202.10108},
  year   = {2022}
}

备注

An extended version of the Neurips paper "ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias". arXiv admin note: substantial text overlap with arXiv:2106.03348