中文

语义图一致性:超越图像块以正则化自监督视觉Transformer

计算机视觉与模式识别 2024-06-21 v1

摘要

自监督学习(SSL)与视觉Transformer(ViT)已被证明在表示学习方面是有效的,这体现在各种下游任务上的出色性能。尽管取得了这些成功,现有的基于ViT的SSL架构并未充分利用ViT骨干网络,特别是ViT的图像块标记。在本文中,我们引入了一个新颖的语义图一致性(SGC)模块来正则化基于ViT的SSL方法,并有效利用图像块标记。我们将图像重新概念化为图,以图像块作为节点,并通过使用图神经网络进行显式消息传递,将关系归纳偏差注入到SSL框架中。我们的SGC损失作为一个正则化器,利用ViT未被充分利用的图像块标记来构建图,并在图像的多个视图之间强制执行图特征的一致性。在包括ImageNet、RESISC和Food-101在内的各种数据集上进行的大量实验表明,我们的方法显著提高了学习表示的质量,在使用有限标记数据进行线性评估时,性能提高了5-10%。这些实验以及全面的消融研究证明了我们的方法在各种设置下的潜力。

关键词

引用

@article{arxiv.2406.12944,
  title  = {Semantic Graph Consistency: Going Beyond Patches for Regularizing Self-Supervised Vision Transformers},
  author = {Chaitanya Devaguptapu and Sumukh Aithal and Shrinivas Ramasubramanian and Moyuru Yamada and Manohar Kaul},
  journal= {arXiv preprint arXiv:2406.12944},
  year   = {2024}
}