中文

TiC:在卷积中探索视觉 Transformer

计算机视觉与模式识别 2024-05-28 v2

摘要

尽管源自视觉 Transformer(ViT)的模型已呈现象级激增,预训练模型无法在不改变架构与配置(例如对位置编码进行采样)的情况下无缝适配任意分辨率图像,这限制了它们在各类视觉任务中的灵活性。例如,基于 ViT-Huge 的 Segment Anything Model(SAM)要求所有输入图像被缩放至 1024×\times1024。为克服此限制,我们提出多头自注意力卷积(MSA-Conv),将自注意力纳入广义卷积中,包括标准、空洞与深度可分离卷积。MSA-Conv 使 transformer 能够处理不同尺寸图像而无需重训练或重缩放,并且相较于 ViT 中的全局注意力进一步降低了计算成本,后者随图像尺寸增大而变得昂贵。随后,我们提出卷积中的视觉 Transformer(TiC)作为使用 MSA-Conv 进行图像分类的概念验证,其中提出了两种容量增强策略,即多方向循环移位机制与插值池化机制,通过在 token 间建立长距离连接并扩大有效感受野来实现。我们进行了大量实验以验证 TiC 的整体有效性。此外,消融研究分别确认了 MSA-Conv 与两种容量增强策略带来的性能提升。需注意,我们的提案旨在研究 ViT 中所用全局注意力的替代方案,而 MSA-Conv 通过使 TiC 在 ImageNet-1K 上媲美 SOTA 达成了我们的目标。代码将发布于 https://github.com/zs670980918/MSA-Conv。

关键词

引用

@article{arxiv.2310.04134,
  title  = {TiC: Exploring Vision Transformer in Convolution},
  author = {Song Zhang and Qingzhong Wang and Jiang Bian and Haoyi Xiong},
  journal= {arXiv preprint arXiv:2310.04134},
  year   = {2024}
}