将全局特征聚合到局部视觉 Transformer 中
计算机视觉与模式识别
2022-02-01 v1
摘要
基于局部 Transformer 的分类模型近期以相对较低的计算成本取得了有前景的结果。然而,在基于局部 Transformer 的架构中聚合空间全局信息的效果尚不清楚。本工作研究了在每个阶段之后的局部窗口-based transformer 中应用名为多分辨率重叠注意力(MOA)的全局注意力模块的结果。所提出的 MOA 在 key 中使用稍大且重叠的 patch 以实现邻域像素信息传输,从而带来显著的性能提升。此外,我们通过大量实验深入研究了基本架构组件维度的影响,并发现了最优的架构设计。在 CIFAR-10、CIFAR-100 和 ImageNet-1K 数据集上的大量实验结果表明,所提方法以相对较少的参数数量优于先前的视觉 Transformer。
引用
@article{arxiv.2201.12903,
title = {Aggregating Global Features into Local Vision Transformer},
author = {Krushi Patel and Andres M. Bur and Fengjun Li and Guanghui Wang},
journal= {arXiv preprint arXiv:2201.12903},
year = {2022}
}