中文

无别名 ViT:通过线性注意力实现分数平移不变性

计算机视觉与模式识别 2025-10-28 v1

摘要

Transformer 已成为视觉任务中 convnets 的有力竞争者,但缺乏 convnets 所具有的架构归纳偏置,可能限制其潜在性能。具体而言,视觉 Transformer (ViT) 对平移不变性不足,对轻微图像平移比标准 convnets 更敏感。此前研究表明,convnets 也并非完美平移不变,因下采样和非线性层中的混叠效应而产生。因此,已提出反混叠方法来 certify convnets 的平移鲁棒性。基于此工作链路,我们提出 Alias-Free ViT,其包含两个主要组件:其一使用无别名下采样和非线性运算;其二采用线性交叉协方差注意力机制,对整数和分数平移均具有平移等价性,从而实现平移不变的全局表示。我们的模型在图像分类任务中保持竞争性能,并在对抗性平移鲁棒性方面优于相似规模的模型。

关键词

引用

@article{arxiv.2510.22673,
  title  = {Alias-Free ViT: Fractional Shift Invariance via Linear Attention},
  author = {Hagay Michaeli and Daniel Soudry},
  journal= {arXiv preprint arXiv:2510.22673},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025. Code is available at https://github.com/hmichaeli/alias_free_vit