SWAT:令牌内部与令牌之间的空间结构
计算机视觉与模式识别
2023-11-21 v3
摘要
近年来,使用注意力机制、前馈网络或卷积将视觉数据建模为令牌(即图像块)已非常有效。此类方法通常具有一个共同流程:一种令牌化方法,随后是一组用于在令牌内部和令牌之间进行信息混合的层/块。当图像块被转换为令牌时,它们通常被展平,丢弃了每个块内的空间结构。因此,随后的任何处理(例如:多头自注意力)可能无法恢复和/或利用此类信息。在本文中,我们认为,当空间结构在令牌化过程中被保留并在混合阶段被显式使用时,模型可以取得显著增益。我们提出两个关键贡献:(1)结构感知令牌化,以及(2)结构感知混合,这两者都可以以最小的代价与现有模型结合。我们引入了一系列模型(SWAT),在包括 ImageNet 分类和 ADE20K 分割在内的多个基准上显示出相对于 DeiT、MLP-Mixer 和 Swin Transformer 等的改进。我们的代码可在 https://github.com/kkahatapitiya/SWAT 获取。
引用
@article{arxiv.2111.13677,
title = {SWAT: Spatial Structure Within and Among Tokens},
author = {Kumara Kahatapitiya and Michael S. Ryoo},
journal= {arXiv preprint arXiv:2111.13677},
year = {2023}
}
备注
Accepted to be published at IJCAI23