基于图像重建的增强自监督学习中的等变表示学习
计算机视觉与模式识别
2024-12-05 v1
摘要
增强自监督学习方法在自监督视觉表示学习中取得了显著的成功,虽在学习不变特征方面表现出色,但常常忽略等变特征。这种局限性会降低基础模型的可泛性,尤其是对于需要等变性的下游任务。我们提出将图像重建任务作为增强自监督学习算法的辅助组件,以无需额外参数的方式促进等变特征学习。该方法通过跨注意力机制融合来自两个增强视图中学习的特征,随后重构其中一个视图。该方法可以适用于各种数据集和增强对学习方法。我们在通过多个线性回归任务学习等变特征以及在人工(3DIEBench)和自然(ImageNet)数据集上的下游应用中评估其有效性。结果一致显示,相对于标准增强自监督学习方法和最新方法,本方法在涉及组合增强的情况下尤其表现出色。我们的 метод增强了不变特征和等变特征的学习,导致计算机视觉任务中更稳健和更具可泛性的视觉表示。
引用
@article{arxiv.2412.03314,
title = {Equivariant Representation Learning for Augmentation-based Self-Supervised Learning via Image Reconstruction},
author = {Qin Wang and Kai Krajsek and Hanno Scharr},
journal= {arXiv preprint arXiv:2412.03314},
year = {2024}
}