RegionViT:面向视觉Transformer的区域到局部注意力
计算机视觉与模式识别
2022-04-01 v3
摘要
视觉Transformer(ViT)近来展现出在图像分类上取得与卷积神经网络(CNN)相当结果的能力。然而,原始ViT直接沿用了自然语言处理中的相同架构,往往未针对视觉应用进行优化。受此启发,本文提出一种采用金字塔结构的新架构,并在视觉Transformer中使用新颖的区域到局部注意力而非全局自注意力。具体而言,我们的模型首先以不同patch尺寸从图像生成区域token与局部token,其中每个区域token依据空间位置关联一组局部token。区域到局部注意力包含两步:首先,区域自注意力在所有区域token间提取全局信息;随后,局部自注意力通过自注意力在一个区域token与其关联的局部token间交换信息。因此,即便局部自注意力将范围限制在局部区域内,仍可获得全局信息。在图像分类、目标与关键点检测、语义分割及动作识别四项视觉任务上的大量实验表明,我们的方法优于或与包括许多同期工作在内的先进ViT变体持平。我们的源代码与模型发布于 https://github.com/ibm/regionvit。
引用
@article{arxiv.2106.02689,
title = {RegionViT: Regional-to-Local Attention for Vision Transformers},
author = {Chun-Fu Chen and Rameswar Panda and Quanfu Fan},
journal= {arXiv preprint arXiv:2106.02689},
year = {2022}
}
备注
add more results and link to codes and models. https://github.com/ibm/regionvit, formatted with ICLR style