中文

Octic 视觉 Transformer:通过等距性实现更快的 ViT

计算机视觉与模式识别 2025-10-01 v4 人工智能 机器学习

摘要

为何当前的 SOTA 视觉 Transformer(ViT)未设计利用诸如 90 度旋转和镜像等自然几何对称性?本文认为并不存在根本原因,所谓缺的只是高效实现。为此,我们提出 Octic 视觉 Transformer(octic ViT),其依赖八分之一群等距性(octic group equivariance)来捕获这些对称性。与先前等距模型增加计算成本不同,我们的 octic 线性层相较于普通线性层实现了 5.33 倍的 FLOPs 减少和最高可达 8 倍的内存减少。在完整的 octic ViT 块中,计算削减趋势接近线性层中所实现的削减幅度,且伴随嵌入维度的增加。我们研究了两个新的 ViT 家族,这些网络均由 octic 块构建,一种是完全 octic 等距,另一种是在网络后部破坏等距性。我们在 ImageNet-1K 上对 octic ViT 进行有监督(DeiT-III)和无监督(DINOv2)训练,发现它们在保持基线准确率的同时,实现了显著的效率提升。

关键词

引用

@article{arxiv.2505.15441,
  title  = {Octic Vision Transformers: Quicker ViTs Through Equivariance},
  author = {David Nordström and Johan Edstedt and Fredrik Kahl and Georg Bökman},
  journal= {arXiv preprint arXiv:2505.15441},
  year   = {2025}
}