Jigsaw-ViT:在 Vision Transformer 中学习拼图游戏
计算机视觉与模式识别
2023-01-06 v2
摘要
Vision Transformer (ViT) 在各种计算机视觉任务上的成功推动了这一无卷积网络日益广泛的应用。ViT 在图像块上工作的特性使其与拼图求解问题潜在相关,后者是一种经典的自监督任务,旨在将打乱顺序的图像块重排回其自然形态。尽管简单,拼图求解已被证明有助于使用卷积神经网络 (CNN) 的多种任务,如自监督特征表示学习、域泛化和细粒度分类。本文中,我们探索将拼图求解作为 ViT 中用于图像分类的自监督辅助损失,称为 Jigsaw-ViT。我们展示了两种使 Jigsaw-ViT 优于标准 ViT 的修改:丢弃位置嵌入与随机掩码图像块。尽管简单,我们发现 Jigsaw-ViT 能够同时提升标准 ViT 的泛化性与鲁棒性,而这通常是一种权衡。实验上,我们表明添加拼图分支在 ImageNet 大规模图像分类上提供了比 ViT 更好的泛化性。此外,该辅助任务还提升了对 Animal-10N、Food-101N 和 Clothing1M 上噪声标签以及对抗样本的鲁棒性。我们的实现见 https://yingyichen-cyy.github.io/Jigsaw-ViT/。
引用
@article{arxiv.2207.11971,
title = {Jigsaw-ViT: Learning Jigsaw Puzzles in Vision Transformer},
author = {Yingyi Chen and Xi Shen and Yahui Liu and Qinghua Tao and Johan A. K. Suykens},
journal= {arXiv preprint arXiv:2207.11971},
year = {2023}
}
备注
Accepted to Pattern Recognition Letters 2022. Project page: https://yingyichen-cyy.github.io/Jigsaw-ViT/