教学至关重要:探究监督在视觉 Transformer 中的作用
计算机视觉与模式识别
2023-04-07 v2 机器学习
摘要
视觉 Transformer(ViTs)近年获得显著流行并扩散至诸多应用。然而,其在不同学习范式下的行为尚未被充分探索。我们比较通过不同监督方法训练的 ViTs,表明它们在注意力、表示与下游性能方面学到广泛多样的行为。我们还发现跨监督一致的 ViT 行为,包括偏移局部注意力头(Offset Local Attention Heads)的出现。这些自注意力头以固定方向偏移注意力于当前词元相邻的词元,据我们所知该现象未在先前任何工作中被强调。我们的分析显示 ViTs 高度灵活,并根据训练方法以不同顺序学习处理局部与全局信息。我们发现对比自监督方法学到的特征与显式监督特征具竞争力,且在部件级任务上甚至更优。我们还发现基于重建的模型表示与对比自监督模型表现出非平凡相似性。项目网站(https://www.cs.umd.edu/~sakshams/vit_analysis)与代码(https://www.github.com/mwalmer-umd/vit_analysis)已公开可用。
引用
@article{arxiv.2212.03862,
title = {Teaching Matters: Investigating the Role of Supervision in Vision Transformers},
author = {Matthew Walmer and Saksham Suri and Kamal Gupta and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2212.03862},
year = {2023}
}
备注
Website: see https://www.cs.umd.edu/~sakshams/vit_analysis. Code: see https://www.github.com/mwalmer-umd/vit_analysis. The first two authors contributed equally. Accepted to CVPR 2023 as conference paper