使视觉 Transformer 真正具有平移等变性
计算机视觉与模式识别
2023-11-30 v2
摘要
在计算机视觉中,视觉 Transformer(ViTs)已成为首选深度网络架构之一。尽管受卷积神经网络(CNNs)启发,ViTs 的输出对输入中的微小空间平移仍然敏感,即不具备平移不变性。为解决此缺陷,我们为 ViTs 中各模块引入新颖的数据自适应设计,如令牌化、自注意力、块合并与位置编码。借助我们提出的模块,我们在四种成熟的 ViTs(即 Swin、SwinV2、CvT 与 MViTv2)上实现了真正的平移等变性。在经验上,我们在图像分类与语义分割任务上评估所提出的自适应模型。这些模型在三个不同数据集上取得有竞争力的性能,同时保持 100% 的平移一致性。
引用
@article{arxiv.2305.16316,
title = {Making Vision Transformers Truly Shift-Equivariant},
author = {Renan A. Rojas-Gomez and Teck-Yian Lim and Minh N. Do and Raymond A. Yeh},
journal= {arXiv preprint arXiv:2305.16316},
year = {2023}
}