中文

HiViT:分层视觉Transformer遇见掩码图像建模

计算机视觉与模式识别 2022-05-31 v1

摘要

近来,掩码图像建模(MIM)为视觉Transformer的自监督预训练提供了新方法。高效实现的一个核心思想是在目标网络(编码器)中丢弃被掩码的图像块(或令牌),这要求编码器为普通视觉Transformer(如ViT),尽管分层视觉Transformer(如Swin Transformer)在构造视觉输入方面具有潜在更优的性质。本文提出一种名为HiViT(Hierarchical ViT的缩写)的分层视觉Transformer新设计,在MIM中兼具高效率与良好性能。关键在于去除不必要的“局部单元间操作”,从而导出结构简单的分层视觉Transformer,其中掩码单元可像普通视觉Transformer一样被序列化。为此,我们从Swin Transformer出发并(i)将掩码单元大小设为Swin Transformer主阶段的令牌大小,(ii)在主阶段之前关闭单元间自注意力,(iii)消除主阶段之后的所有操作。实证研究表明HiViT在全监督、自监督及迁移学习中均具优越性能。特别是在ImageNet-1K上运行MAE时,HiViT-B较ViT-B准确率提升0.6%,较Swin-B加速1.9×\times,且性能增益可泛化至检测与分割等下游任务。代码将公开可用。

关键词

引用

@article{arxiv.2205.14949,
  title  = {HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling},
  author = {Xiaosong Zhang and Yunjie Tian and Wei Huang and Qixiang Ye and Qi Dai and Lingxi Xie and Qi Tian},
  journal= {arXiv preprint arXiv:2205.14949},
  year   = {2022}
}