HiViT:分层视觉Transformer遇见掩码图像建模
计算机视觉与模式识别
2022-05-31 v1
摘要
近来,掩码图像建模(MIM)为视觉Transformer的自监督预训练提供了新方法。高效实现的一个核心思想是在目标网络(编码器)中丢弃被掩码的图像块(或令牌),这要求编码器为普通视觉Transformer(如ViT),尽管分层视觉Transformer(如Swin Transformer)在构造视觉输入方面具有潜在更优的性质。本文提出一种名为HiViT(Hierarchical ViT的缩写)的分层视觉Transformer新设计,在MIM中兼具高效率与良好性能。关键在于去除不必要的“局部单元间操作”,从而导出结构简单的分层视觉Transformer,其中掩码单元可像普通视觉Transformer一样被序列化。为此,我们从Swin Transformer出发并(i)将掩码单元大小设为Swin Transformer主阶段的令牌大小,(ii)在主阶段之前关闭单元间自注意力,(iii)消除主阶段之后的所有操作。实证研究表明HiViT在全监督、自监督及迁移学习中均具优越性能。特别是在ImageNet-1K上运行MAE时,HiViT-B较ViT-B准确率提升0.6%,较Swin-B加速1.9,且性能增益可泛化至检测与分割等下游任务。代码将公开可用。
引用
@article{arxiv.2205.14949,
title = {HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling},
author = {Xiaosong Zhang and Yunjie Tian and Wei Huang and Qixiang Ye and Qi Dai and Lingxi Xie and Qi Tian},
journal= {arXiv preprint arXiv:2205.14949},
year = {2022}
}