中文

具有甜甜圈核的图案注意力 Transformer

计算机视觉与模式识别 2023-09-19 v5 机器学习

摘要

我们在本文中提出一种新架构,即图案注意力 Transformer(PAT),它由新型的甜甜圈核组成。与 NLP 领域中的 token 相比,计算机视觉中的 Transformer 存在处理图像中像素高分辨率的问题。在 ViT 中,图像被切成方形块。作为 ViT 的后续,Swin Transformer 提出了一个额外的移位步骤以减少固定边界的存在,这也导致“两个相连的 Swin Transformer 块”作为模型的最小单元。继承块/窗口思想,我们的甜甜圈核进一步增强了块的设计。它基于对自身注意力(命名为 QKVA 网格)的理解,用两类区域——传感区和更新区——替代了线切边界。甜甜圈核也带来了一个关于超越方形的核形状的新话题。为验证其在图像分类上的性能,PAT 被设计为具有正八边形甜甜圈核的 Transformer 块。其架构更轻量:每个阶段的最小图案注意力层仅为一个。在相似的计算复杂度下,其在 ImageNet 1K 上的吞吐量更高(+10%)并超越 Swin Transformer(+0.8 acc1)。

关键词

引用

@article{arxiv.2211.16961,
  title  = {Pattern Attention Transformer with Doughnut Kernel},
  author = {WenYuan Sheng},
  journal= {arXiv preprint arXiv:2211.16961},
  year   = {2023}
}