中文

Clebsch-Gordan Transformer:快速全局等距注意力

机器学习 2025-09-30 v1 计算机视觉与模式识别 机器人学

摘要

全局注意力机制是transformer架构成功的关键因素之一,但其计算复杂度随着token数量呈二次增长。另一方面,等位模型利用问题实例的几何结构,往往在物理、生化、计算机视觉和机器人任务中实现卓越的准确率,但计算要求更高。结果是,现有的等位transformer仅支持低阶等位特征和局部上下文窗口,限制了其表达能力和性能。本工作提出了Clebsch-Gordan Transformer,通过一种新颖的Clebsch-Gordan卷积实现对\SO(3)\SO(3)不可约表示的全局等位注意力。我们的方法能够在所有阶数上实现等位建模,同时将输入token复杂度降低到O(NlogN){O}(N \log N)。此外,所提出的方法通过利用Clebsch-Gordan矩阵的稀疏性,在高阶不可约特征方面表现良好。最后,我们还通过权重共享或数据增强等方式,可选地包含token排列等位性。我们在包括n体模拟、QM9、ModelNet点云分类和机器人抓取数据集等多样化的基准上进行测试,显示在GPU内存大小、速度和准确率方面相比现有的等位transformer具有明显优势。

关键词

引用

@article{arxiv.2509.24093,
  title  = {Clebsch-Gordan Transformer: Fast and Global Equivariant Attention},
  author = {Owen Lewis Howell and Linfeng Zhao and Xupeng Zhu and Yaoyao Qian and Haojie Huang and Lingfeng Sun and Wil Thomason and Robert Platt and Robin Walters},
  journal= {arXiv preprint arXiv:2509.24093},
  year   = {2025}
}