中文

重新审视预训练普通视觉 Transformer 中的层次结构

计算机视觉与模式识别 2022-11-09 v2

摘要

通过掩码图像建模(MIM)进行自监督预训练视觉 Transformer(ViT)已被证明非常有效。然而,针对层次化 ViT 需精心设计定制算法,例如 GreenMIM,而非对普通 ViT 使用朴素简单的 MAE。更重要的是,由于这些层次化 ViT 无法复用普通 ViT 现成的预训练权重,对其预训练的需求带来了大量计算开销,从而引发了算法与计算上的双重复杂度。本文中,我们通过提出一种将层次化架构设计与自监督预训练解耦的新思路来解决该问题。我们以极小的改动将普通 ViT 转化为层次化架构。技术上,我们将线性嵌入层的步长由 16 改为 4,并在 Transformer 块之间添加卷积(或简单平均)池化层,从而将特征尺寸从 1/4 依次缩减至 1/32。尽管简单,它在 ImageNet、MS COCO、Cityscapes 和 ADE20K 基准的分类、检测与分割任务上均优于普通 ViT 基线。我们希望这一初步研究能引起社区更多关注,以开发高效的(层次化)ViT,同时借助现成检查点避免预训练开销。代码与模型将于 https://github.com/ViTAE-Transformer/HPViT 发布。

关键词

引用

@article{arxiv.2211.01785,
  title  = {Rethinking Hierarchies in Pre-trained Plain Vision Transformer},
  author = {Yufei Xu and Jing Zhang and Qiming Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2211.01785},
  year   = {2022}
}

备注

Tech report, work in progress