中文

用于自监督视觉Transformer的位置标签

计算机视觉与模式识别 2023-02-17 v3

摘要

位置编码对于视觉Transformer(ViT)捕获输入图像的空间结构十分重要。其在ViT中的普遍有效性已得到证明。在我们的工作中,我们提出训练ViT识别输入图像块的位置标签,这一看似简单的任务实际上产生了一个有意义的自监督任务。基于先前关于ViT位置编码的工作,我们提出了两种专用于二维图像的位置标签,包括绝对位置和相对位置。我们的位置标签可以轻松插入到当前各种ViT变体中。它可以通过两种方式工作:(a) 作为普通ViT(如ViT-B和Swin-B)的辅助训练目标以获得更好性能。(b) 结合自监督ViT(如MAE)为语义特征学习提供更强的自监督信号。实验表明,使用所提出的自监督方法,ViT-B和Swin-B在ImageNet上分别获得1.20%(top-1准确率)和0.74%(top-1准确率)的提升,在Mini-ImageNet上分别获得6.15%和1.14%的提升。

关键词

引用

@article{arxiv.2206.04981,
  title  = {Positional Label for Self-Supervised Vision Transformer},
  author = {Zhemin Zhang and Xun Gong},
  journal= {arXiv preprint arXiv:2206.04981},
  year   = {2023}
}