论局部注意力与动态深度可分离卷积之间的联系
计算机视觉与模式识别
2022-08-05 v5
摘要
Vision Transformer(ViT)在视觉识别中达到了最先进的性能,而其变体局部视觉 Transformer(Local Vision Transformer)进一步提升了性能。局部视觉 Transformer 的主要组件局部注意力(local attention)在小局部窗口上分别执行注意力。我们将局部注意力重新表述为通道级局部连接层,并从两种网络正则化方式(稀疏连接和权重共享)以及权重计算对其进行分析。稀疏连接:通道间无连接,每个位置仅与一个小局部窗口内的位置相连。权重共享:一个位置的连接权重在通道间或每组通道内共享。动态权重:连接权重根据每个图像实例动态预测。我们指出局部注意力在稀疏连接上类似于深度可分离卷积(depth-wise convolution)及其动态版本。主要区别在于权重共享——深度可分离卷积在空间位置上共享连接权重(核权重)。我们通过实验观察到,基于深度可分离卷积及其动态变体(计算复杂度更低)的模型在 ImageNet 分类、COCO 目标检测和 ADE 语义分割上表现与局部视觉 Transformer 的实例 Swin Transformer 相当或有时略优。这些观察表明,局部视觉 Transformer 利用了两种正则化形式和动态权重来增加网络容量。代码见 https://github.com/Atten4Vis/DemystifyLocalViT。
引用
@article{arxiv.2106.04263,
title = {On the Connection between Local Attention and Dynamic Depth-wise Convolution},
author = {Qi Han and Zejia Fan and Qi Dai and Lei Sun and Ming-Ming Cheng and Jiaying Liu and Jingdong Wang},
journal= {arXiv preprint arXiv:2106.04263},
year = {2022}
}
备注
ICLR 2022 Spotlight