中文

面向掩码图像建模的绿色分层视觉Transformer

计算机视觉与模式识别 2022-10-17 v2 机器学习

摘要

我们提出了一种用于分层Vision Transformers(ViTs)的掩码图像建模(MIM)高效方法,使分层ViTs能够丢弃被掩码的图像块并仅对可见块进行操作。我们的方法包含三个关键设计。首先,对于窗口注意力,我们遵循分治策略提出了分组窗口注意力方案。为缓解自注意力相对于图像块数量的二次复杂度,分组注意力鼓励均匀划分,使任意大小的每个局部窗口内的可见块能以相等大小分组,随后在各组内执行掩码自注意力。其次,我们通过动态规划算法进一步改进分组策略,以最小化分组块上注意力的总体计算代价。第三,对于卷积层,我们将其转为稀疏卷积,该卷积与稀疏数据(即MIM中的可见块)无缝协作。因此,MIM现在能以绿色高效的方式作用于绝大多数(即便不是全部)分层ViTs。例如,我们可以以约2.7×\times更快的速度训练分层ViTs(如Swin Transformer与Twins Transformer),并将GPU内存占用降低70%,同时在ImageNet分类上仍具竞争性能,并在下游COCO目标检测基准上展现优越性。代码与预训练模型已公开于https://github.com/LayneH/GreenMIM。

关键词

引用

@article{arxiv.2205.13515,
  title  = {Green Hierarchical Vision Transformer for Masked Image Modeling},
  author = {Lang Huang and Shan You and Mingkai Zheng and Fei Wang and Chen Qian and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2205.13515},
  year   = {2022}
}

备注

Accepted at NeurIPS 2022. 18 pages, 7 figures, 6 tables, and 3 algorithms