视觉 Transformer 能否脱离自然图像学习?
计算机视觉与模式识别
2021-03-25 v1
摘要
我们能否在没有自然图像和人工标注标签的情况下完成视觉 Transformer(ViT)的预训练?尽管预训练的 ViT 似乎严重依赖大规模数据集和人工标注标签,但近期大规模数据集在隐私侵犯、公平性保护不足和标注劳动密集等方面存在若干问题。在本文中,我们在无任何图像收集和标注劳动的情况下预训练 ViT。我们通过实验验证,所提框架在预训练阶段不使用任何自然图像的情况下,部分优于诸如 SimCLRv2 和 MoCov2 等复杂的自监督学习(SSL)方法。此外,尽管无自然图像预训练的 ViT 产生的一些可视化结果与 ImageNet 预训练的 ViT 不同,它能在很大程度上解释自然图像数据集。例如,在 CIFAR-10 数据集上的性能率为:我们的方案 97.6 对比 SimCLRv2 97.4 对比 ImageNet 98.0。
关键词
引用
@article{arxiv.2103.13023,
title = {Can Vision Transformers Learn without Natural Images?},
author = {Kodai Nakashima and Hirokatsu Kataoka and Asato Matsumoto and Kenji Iwata and Nakamasa Inoue},
journal= {arXiv preprint arXiv:2103.13023},
year = {2021}
}
备注
Project page: https://hirokatsukataoka16.github.io/Vision-Transformers-without-Natural-Images/