中文

Fibottention:基于多头注意力的先验视觉表示学习

计算机视觉与模式识别 2026-02-16 v4

摘要

视觉变换器及其变体在 diverse visual perception tasks 中取得了显著的成功。尽管其有效性却存在两个显著局限性:首先,多头自注意力 (MHSA) 的二次计算复杂度限制了大规模标记数的可扩展性,其次,仅凭大规模训练数据难以达到竞争性能。本文为此,我们提出一种新型稀疏自注意力机制,称为 Fibottention。Fibottention 采用源自 Wythoff 数组的结构稀疏模式,实现自注意力中的 O(NlogN)\mathcal{O}(N \log N) 计算复杂度。就其而言,其稀疏模式在注意力头之间变化,这从理论上证明可减少冗余的成对相互作用,同时确保充分且多样的覆盖。这导致注意力头中产生类似 Inception 的功能多样性,促进更具信息性和解缠的表示。我们将 Fibottention 集成到标准 Transformer 架构中,并在多个领域进行大规模实验,包括图像分类、视频理解和机器人学习。结果表明,采用 Fibottention 的模型要么显著优于, 要么与其稠密 MHSA 对手相当,同时仅使用自注意力头中所有成对相互作用的 2%2\%,在典型设置下为 26%2-6\%,造成显著的计算节省。此外,与现有的稀疏注意力机制相比,Fibottention 在 FLOP 等效基础上始终实现优异结果。最后,我们深入分析了注意力设计所带来的增强特征多样性,并讨论了其对高效表示学习的含义。

关键词

引用

@article{arxiv.2406.19391,
  title  = {Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads},
  author = {Ali K. Rahimian and Manish K. Govind and Subhajit Maity and Dominick Reilly and Christian Kümmerle and Srijan Das and Aritra Dutta},
  journal= {arXiv preprint arXiv:2406.19391},
  year   = {2026}
}

备注

The complete implementation, including source code and evaluation scripts, is publicly available at: https://github.com/Charlotte-CharMLab/Fibottention