中文

将视觉Transformer解释为带动态卷积的ConvNet

计算机视觉与模式识别 2023-09-20 v1

摘要

关于视觉Transformer与ConvNet作为计算机视觉模型骨干网络孰优孰劣一直存在争论。尽管它们通常被视为两种完全不同的架构,本文中我们将视觉Transformer解释为带动态卷积的ConvNet,从而能够在统一框架中刻画现有的Transformer与动态ConvNet,并逐一比较它们的设计选择。此外,我们的解释也可指导网络设计,因为研究者现在可以从ConvNet的设计空间来考虑视觉Transformer,反之亦然。我们通过两项具体研究展示了这种潜力。首先,我们考察视觉Transformer中softmax作为激活函数的作用,发现它可以被常用的ConvNet模块(如ReLU和Layer Normalization)替代,从而获得更快的收敛速度和更好的性能。其次,遵循深度可分离卷积的设计,我们创建了对应的深度可分离视觉Transformer,其更高效且性能相当。所提出的统一解释的潜力不限于上述例子,我们希望它能启发学界并催生更先进的网络架构。

关键词

引用

@article{arxiv.2309.10713,
  title  = {Interpret Vision Transformers as ConvNets with Dynamic Convolutions},
  author = {Chong Zhou and Chen Change Loy and Bo Dai},
  journal= {arXiv preprint arXiv:2309.10713},
  year   = {2023}
}