中文

轴注意力深度网络:用于全景分割的独立轴向自注意力

代数拓扑 2026-03-30 v3 群论 表示论

摘要

卷积利用局部性以获得效率,代价是缺失长程上下文。自注意力已被采用以增强 CNN 的非局部交互。近期工作证明,通过将注意力限制于局部区域,可以堆叠自注意力层以获得全注意力网络。在本文中,我们尝试通过将对 2D 自注意力分解为两个 1D 自注意力来移除该约束。这降低了计算复杂度,并允许在更大甚至全局区域内执行注意力。与此同时,我们还提出了一种位置敏感的自注意力设计。二者结合产生了我们的位置敏感轴向注意力层,这是一种新颖的构建模块,可堆叠形成用于图像分类和密集预测的轴向注意力模型。我们在四个大规模数据集上证明了我们模型的有效性。特别地,我们的模型在 ImageNet 上优于所有现有的独立自注意力模型。我们的 Axial-DeepLab 在 COCO test-dev 上比自底向上最先进技术高出 2.8% PQ。这一先前的最先进技术由我们的小变体达到,其参数效率高 3.8 倍、计算效率高 27 倍。Axial-DeepLab 还在 Mapillary Vistas 和 Cityscapes 上取得了最先进的结果。

关键词

引用

@article{arxiv.2003.07852,
  title  = {String topology of finite groups of Lie type},
  author = {Jesper Grodal and Anssi Lahtinen},
  journal= {arXiv preprint arXiv:2003.07852},
  year   = {2026}
}

备注

80 pages. v2: Major revision. Improvements include comparison of string products, asymptotic existence of fundamental classes, and improved ring structure preservation. v3: Fix reference