自监督视觉Transformer学到了什么
计算机视觉与模式识别
2023-05-02 v1 人工智能
机器学习
摘要
我们对对比学习(CL)与掩码图像建模(MIM)在表示及下游任务性能上的差异及其原因进行了比较研究。具体而言,我们证明了自监督视觉Transformer(ViTs)具有以下性质:(1) CL训练出的自注意力比MIM能捕捉更长程的全局模式,例如物体的形状,尤其是在ViT架构的较深层中。这一CL性质有助于ViT在其表示空间中线性分离图像。然而,它也使得自注意力对所有查询token和头坍缩为同质化。这种自注意力的同质化降低了表示的多样性,恶化了可扩展性与密集预测性能。(2) CL利用表示的低频信号,而MIM利用高频信号。由于低频与高频信息分别表征形状与纹理,CL更偏向形状,MIM更偏向纹理。(3) CL在较深层中起关键作用,而MIM主要关注浅层。基于这些分析,我们发现CL与MIM可互补,并观察到即便最简单的协调方式也有助于兼顾两种方法之长。代码见 https://github.com/naver-ai/cl-vs-mim。
引用
@article{arxiv.2305.00729,
title = {What Do Self-Supervised Vision Transformers Learn?},
author = {Namuk Park and Wonjae Kim and Byeongho Heo and Taekyung Kim and Sangdoo Yun},
journal= {arXiv preprint arXiv:2305.00729},
year = {2023}
}
备注
ICLR 2023