目标至关重要:理解自监督目标对视觉 Transformer 表征的影响
机器学习
2023-04-27 v1 计算机视觉与模式识别
图像与视频处理
摘要
基于联合嵌入的学习(如 SimCLR、MoCo、DINO)与基于重建的学习(如 BEiT、SimMIM、MAE)是视觉 transformer 自监督学习的两大主导范式,但二者在迁移性能上差异显著。本文旨在通过分析方法揭示这些差异,考察此类目标对学习表征结构与可迁移性的影响。我们的分析表明,基于重建的学习特征与基于联合嵌入的学习特征显著不同,且采用相似目标训练的模型即便跨架构也能学到相似特征。这些差异在网络早期即出现,主要由注意力与归一化层驱动。我们发现,联合嵌入特征在分类线性探测迁移上更优,因为不同目标驱动了学习表征中信息与不变性的不同分布。这些差异解释了在需要特征空间特异性的下游任务中迁移性能的相反趋势。最后,我们探讨了微调如何改变重建表征以实现更好迁移,表明微调将信息重新组织得更接近预训练的联合嵌入模型。
引用
@article{arxiv.2304.13089,
title = {Objectives Matter: Understanding the Impact of Self-Supervised Objectives on Vision Transformer Representations},
author = {Shashank Shekhar and Florian Bordes and Pascal Vincent and Ari Morcos},
journal= {arXiv preprint arXiv:2304.13089},
year = {2023}
}