视觉 Transformer 学到了什么?一项可视化探索
计算机视觉与模式识别
2022-12-14 v1
摘要
视觉 transformer(ViT)正迅速成为计算机视觉的事实标准架构,然而我们对其为何有效以及学到了什么知之甚少。尽管已有研究对卷积神经网络的机制进行了可视化分析,但对 ViT 的类似探索仍具挑战性。本文中,我们首先解决在 ViT 上执行可视化的障碍。在这些解决方案的辅助下,我们观察到使用语言模型监督(如 CLIP)训练的 ViT 中的神经元由语义概念而非视觉特征激活。我们还探讨了 ViT 与 CNN 之间的根本差异,发现 transformer 像其卷积对应物一样检测图像背景特征,但其预测对高频信息的依赖要小得多。另一方面,两种架构类型在特征从早期层的抽象模式进展到后期层的具体对象的方式上表现相似。此外,我们展示 ViT 在除最后一层外的所有层中都保持空间信息。与之前的工作相反,我们表明最后一层最可能丢弃空间信息并表现为一种学习到的全局池化操作。最后,我们在包括 DeiT、CoaT、ConViT、PiT、Swin 和 Twin 在内的广泛 ViT 变体上进行大规模可视化,以验证我们方法的有效性。
引用
@article{arxiv.2212.06727,
title = {What do Vision Transformers Learn? A Visual Exploration},
author = {Amin Ghiasi and Hamid Kazemi and Eitan Borgnia and Steven Reich and Manli Shu and Micah Goldblum and Andrew Gordon Wilson and Tom Goldstein},
journal= {arXiv preprint arXiv:2212.06727},
year = {2022}
}