Twins:重新审视视觉 Transformer 中空间注意力的设计
计算机视觉与模式识别
2021-10-01 v4 人工智能
机器学习
摘要
近来,针对密集预测任务提出了多种视觉 transformer 架构,并且它们表明空间注意力的设计对于这些任务中的成功至关重要。在这项工作中,我们重新审视空间注意力的设计,并证明一个精心设计的却简单的空间注意力机制优于最先进的方案。据此,我们提出了两种视觉 transformer 架构,即 Twins-PCPVT 和 Twins-SVT。我们提出的架构高效且易于实现,仅涉及在现代深度学习框架中高度优化的矩阵乘法。更重要的是,所提架构在广泛的视觉任务上取得了优异性能,包括图像级分类以及密集检测与分割。其简洁性与强劲性能表明,我们所提架构可作为许多视觉任务的更强骨干网络。我们的代码发布于 https://github.com/Meituan-AutoML/Twins 。
引用
@article{arxiv.2104.13840,
title = {Twins: Revisiting the Design of Spatial Attention in Vision Transformers},
author = {Xiangxiang Chu and Zhi Tian and Yuqing Wang and Bo Zhang and Haibing Ren and Xiaolin Wei and Huaxia Xia and Chunhua Shen},
journal= {arXiv preprint arXiv:2104.13840},
year = {2021}
}
备注
Accepted to NeurIPS2021