中文

$E(2)$-等变视觉 Transformer

计算机视觉与模式识别 2023-07-10 v3 人工智能

摘要

Vision Transformer(ViT)在计算机视觉中取得了卓越性能。然而,ViT 中的位置编码使其极难学习数据中内在的等变性。已有一些设计等变 ViT 的初步尝试,但本文证明其在某些情况下存在缺陷。为解决此问题,我们通过一种新颖、有效的位置编码算子设计了群等变视觉 Transformer(GE-ViT)。我们证明 GE-ViT 满足等变神经网络的所有理论要求。在标准基准数据集上进行了全面实验,表明 GE-ViT 显著优于非等变自注意力网络。代码见 https://github.com/ZJUCDSYangKaifan/GEVit。

关键词

引用

@article{arxiv.2306.06722,
  title  = {$E(2)$-Equivariant Vision Transformer},
  author = {Renjun Xu and Kaifan Yang and Ke Liu and Fengxiang He},
  journal= {arXiv preprint arXiv:2306.06722},
  year   = {2023}
}

备注

Accept to UAI2023