自监督视觉 Transformer 中涌现的特性
计算机视觉与模式识别
2021-05-25 v2
摘要
在本文中,我们探讨自监督学习是否为 Vision Transformer (ViT) 提供了相较于卷积网络(convnets)而言脱颖而出的新特性。除了将自监督方法适配到该架构上效果特别好这一事实外,我们还有以下观察:首先,自监督 ViT 特征包含关于图像语义分割的显式信息,这在有监督 ViT 和卷积网络中都不会如此清晰地涌现。其次,这些特征也是优秀的 k-NN 分类器,在 ImageNet 上用小型 ViT 达到了 78.3% 的 top-1 准确率。我们的研究还强调了动量编码器、多裁剪训练以及 ViT 中使用小图像块的重要性。我们将发现实现为一种简单的自监督方法,称为 DINO,我们将其解释为一种无标签的自蒸馏形式。我们通过 ViT-Base 在线性评估中达到 ImageNet 上 80.1% 的 top-1 准确率,展示了 DINO 与 ViT 之间的协同作用。
引用
@article{arxiv.2104.14294,
title = {Emerging Properties in Self-Supervised Vision Transformers},
author = {Mathilde Caron and Hugo Touvron and Ishan Misra and Hervé Jégou and Julien Mairal and Piotr Bojanowski and Armand Joulin},
journal= {arXiv preprint arXiv:2104.14294},
year = {2021}
}
备注
21 pages