用于自监督视觉Transformer的位置标签
计算机视觉与模式识别
2023-02-17 v3
摘要
位置编码对于视觉Transformer(ViT)捕获输入图像的空间结构十分重要。其在ViT中的普遍有效性已得到证明。在我们的工作中,我们提出训练ViT识别输入图像块的位置标签,这一看似简单的任务实际上产生了一个有意义的自监督任务。基于先前关于ViT位置编码的工作,我们提出了两种专用于二维图像的位置标签,包括绝对位置和相对位置。我们的位置标签可以轻松插入到当前各种ViT变体中。它可以通过两种方式工作:(a) 作为普通ViT(如ViT-B和Swin-B)的辅助训练目标以获得更好性能。(b) 结合自监督ViT(如MAE)为语义特征学习提供更强的自监督信号。实验表明,使用所提出的自监督方法,ViT-B和Swin-B在ImageNet上分别获得1.20%(top-1准确率)和0.74%(top-1准确率)的提升,在Mini-ImageNet上分别获得6.15%和1.14%的提升。
引用
@article{arxiv.2206.04981,
title = {Positional Label for Self-Supervised Vision Transformer},
author = {Zhemin Zhang and Xun Gong},
journal= {arXiv preprint arXiv:2206.04981},
year = {2023}
}