细察空间建模:从注意力到卷积
计算机视觉与模式识别
2022-12-27 v1 人工智能
机器学习
摘要
Vision Transformers 凭借富有洞见的架构设计与注意力机制,近期在许多视觉任务上展现出巨大潜力。通过重访 Transformers 中的自注意力响应,我们经验性地观察到两个有趣现象。首先,Vision Transformers 在深层表现出与查询无关的行为,无论查询块位置(也与头无关)如何,注意力图在全局范围内呈现出近乎一致的内容。其次,注意力图本质上是稀疏的,少数 token 主导了注意力权重;引入来自 ConvNets 的知识将大幅平滑注意力并提升性能。受上述观察启发,我们将自注意力公式推广,直接抽象出与查询无关的全局上下文,并进一步将全局上下文整合进卷积中。由此得到的模型,即全卷积视觉 Transformer(FCViT),完全由卷积层构成,并牢固继承了注意力机制与卷积的优点,包括动态特性、权值共享以及短程与长程特征建模等。实验结果证明了 FCViT 的有效性。在参数量少于 14M 的情况下,我们的 FCViT-S12 在 ImageNet-1K 上以 3.7% 的 top1 准确率优于相关工作 ResT-Lite。当将 FCViT 扩展至更大模型时,我们仍能以更少的参数量优于先前的 SOTA ConvNeXt。基于 FCViT 的模型也对下游任务(如目标检测、实例分割和语义分割)展现出良好的可迁移性。代码与模型已发布于:https://github.com/ma-xu/FCViT。
引用
@article{arxiv.2212.12552,
title = {A Close Look at Spatial Modeling: From Attention to Convolution},
author = {Xu Ma and Huan Wang and Can Qin and Kunpeng Li and Xingchen Zhao and Jie Fu and Yun Fu},
journal= {arXiv preprint arXiv:2212.12552},
year = {2022}
}