简单有效的平凡群等变视觉变换器
计算机视觉与模式识别
2026-02-10 v1
摘要
将对称先验作为归纳偏置来设计等变视觉变换器(ViT)已成为提高其性能的有前景的方向。然而,现有的等变ViT往往难以在性能与等变性之间取得平衡,主要由于在ViT的各个模块中实现全面等变性修改——尤其是在自注意力机制与补丁嵌入之间的和谐——存在挑战。为此,我们提出了一个简单框架,系统性地使关键ViT组件(包括补丁嵌入、自注意力、位置编码以及下/上采样)实现等变性,从而构建具有保证等变性的ViT。该架构作为即插即用式的替换方案,既在理论上有依据,又在实际应用中具有高度的可扩展性,甚至可以无缝扩展到Swin变换器。广泛的实验表明,我们的等变ViT在广泛的视觉任务中 consistently 能提升性能和数据效率。
引用
@article{arxiv.2602.08047,
title = {Vanilla Group Equivariant Vision Transformer: Simple and Effective},
author = {Jiahong Fu and Qi Xie and Deyu Meng and Zongben Xu},
journal= {arXiv preprint arXiv:2602.08047},
year = {2026}
}