TiC:在卷积中探索视觉 Transformer
计算机视觉与模式识别
2024-05-28 v2
摘要
尽管源自视觉 Transformer(ViT)的模型已呈现象级激增,预训练模型无法在不改变架构与配置(例如对位置编码进行采样)的情况下无缝适配任意分辨率图像,这限制了它们在各类视觉任务中的灵活性。例如,基于 ViT-Huge 的 Segment Anything Model(SAM)要求所有输入图像被缩放至 10241024。为克服此限制,我们提出多头自注意力卷积(MSA-Conv),将自注意力纳入广义卷积中,包括标准、空洞与深度可分离卷积。MSA-Conv 使 transformer 能够处理不同尺寸图像而无需重训练或重缩放,并且相较于 ViT 中的全局注意力进一步降低了计算成本,后者随图像尺寸增大而变得昂贵。随后,我们提出卷积中的视觉 Transformer(TiC)作为使用 MSA-Conv 进行图像分类的概念验证,其中提出了两种容量增强策略,即多方向循环移位机制与插值池化机制,通过在 token 间建立长距离连接并扩大有效感受野来实现。我们进行了大量实验以验证 TiC 的整体有效性。此外,消融研究分别确认了 MSA-Conv 与两种容量增强策略带来的性能提升。需注意,我们的提案旨在研究 ViT 中所用全局注意力的替代方案,而 MSA-Conv 通过使 TiC 在 ImageNet-1K 上媲美 SOTA 达成了我们的目标。代码将发布于 https://github.com/zs670980918/MSA-Conv。
引用
@article{arxiv.2310.04134,
title = {TiC: Exploring Vision Transformer in Convolution},
author = {Song Zhang and Qingzhong Wang and Jiang Bian and Haoyi Xiong},
journal= {arXiv preprint arXiv:2310.04134},
year = {2024}
}