基于几何变换敏感架构的非对象中心图像自监督学习
计算机视觉与模式识别
2023-05-18 v7
摘要
大多数基于不变性的自监督方法依赖于单对象中心图像(如 ImageNet 图像)进行预训练,学习对几何变换不变的特征。然而,当图像并非对象中心时,由于裁剪,图像的语义可能发生显著改变。此外,随着模型对几何变换变得不敏感,它可能难以捕捉位置信息。为此,我们提出一种对几何变换敏感的几何变换敏感架构(Geometric Transformation Sensitive Architecture),专门聚焦于四重旋转、随机裁剪与多裁剪。我们的方法通过预测旋转,并利用随这些变换而改变的目标(通过对教师特征图进行池化与旋转得到)来鼓励学生网络保持敏感。此外,我们使用块对应损失来鼓励具有相似特征的块之间的对应。这种方式使我们能够以比通过鼓励局部到全局对应(发生于学习对多裁剪不敏感时)更恰当的方式捕捉长程依赖。在使用非对象中心图像作为预训练数据时,我们的方法相较于其他训练模型对几何变换不敏感的方法表现出更优性能。我们在图像分类、语义分割、检测与实例分割任务上超越 DINO [Caron et al. [2021b]] 基线,分别提升 4.9 、3.3 、3.4 与 2.7 。代码与预训练模型公开于:https://github.com/bok3948/GTSA
引用
@article{arxiv.2304.08014,
title = {Self-Supervised Learning from Non-Object Centric Images with a Geometric Transformation Sensitive Architecture},
author = {Taeho Kim and Jong-Min Lee},
journal= {arXiv preprint arXiv:2304.08014},
year = {2023}
}