中文

自监督视觉Transformer学到了什么

计算机视觉与模式识别 2023-05-02 v1 人工智能 机器学习

摘要

我们对对比学习(CL)与掩码图像建模(MIM)在表示及下游任务性能上的差异及其原因进行了比较研究。具体而言,我们证明了自监督视觉Transformer(ViTs)具有以下性质:(1) CL训练出的自注意力比MIM能捕捉更长程的全局模式,例如物体的形状,尤其是在ViT架构的较深层中。这一CL性质有助于ViT在其表示空间中线性分离图像。然而,它也使得自注意力对所有查询token和头坍缩为同质化。这种自注意力的同质化降低了表示的多样性,恶化了可扩展性与密集预测性能。(2) CL利用表示的低频信号,而MIM利用高频信号。由于低频与高频信息分别表征形状与纹理,CL更偏向形状,MIM更偏向纹理。(3) CL在较深层中起关键作用,而MIM主要关注浅层。基于这些分析,我们发现CL与MIM可互补,并观察到即便最简单的协调方式也有助于兼顾两种方法之长。代码见 https://github.com/naver-ai/cl-vs-mim。

关键词

引用

@article{arxiv.2305.00729,
  title  = {What Do Self-Supervised Vision Transformers Learn?},
  author = {Namuk Park and Wonjae Kim and Byeongho Heo and Taekyung Kim and Sangdoo Yun},
  journal= {arXiv preprint arXiv:2305.00729},
  year   = {2023}
}

备注

ICLR 2023