分层视觉 Transformer 的关键何在?
计算机视觉与模式识别
2021-09-13 v2 人工智能
机器学习
摘要
近期研究表明,具有交错的非重叠基于窗口的自注意力与偏移窗口操作宏架构的分层 Vision Transformer 能够在各类视觉识别任务中取得最先进性能,并以密集滑动核的方式挑战无处不在的卷积神经网络(CNNs)。多数后续工作试图用其他跨窗口通信范式替换偏移窗口操作,同时将自注意力视为基于窗口的信息聚合的事实标准。在本文中,我们质疑自注意力是否是分层 Vision Transformer 取得强劲性能的唯一选择,以及不同跨窗口通信方式的影响。为此,我们将自注意力层替换为极其简单的线性映射层,由此得到的概念验证架构称为 LinMapper,其在 ImageNet-1k 图像识别中可取得非常强劲的性能。此外,我们发现 LinMapper 能更好地利用图像识别的预训练表示,并在目标检测与实例分割等下游密集预测任务上展现出优异的迁移学习特性。我们还尝试了在其他跨窗口通信方法下,用于各非重叠窗口内内容聚合的自注意力的其他替代方案,均给出相似的竞争性结果。我们的研究揭示,Swin 模型族的宏架构(而非特定的聚合层或特定的跨窗口通信方式)可能更对其强劲性能负责,并且是 ubiquitous CNN 密集滑动窗口范式真正的挑战者。代码与模型将公开以促进未来研究。
引用
@article{arxiv.2107.02174,
title = {What Makes for Hierarchical Vision Transformer?},
author = {Yuxin Fang and Xinggang Wang and Rui Wu and Wenyu Liu},
journal= {arXiv preprint arXiv:2107.02174},
year = {2021}
}