中文

压缩定理:Transformer 的复杂度为 O(n),而非 $O(n^2)$

机器学习 2026-02-11 v2 人工智能 计算与语言

摘要

我们提出压缩定理:注意力稀疏性是一种已学习的拓扑属性,而非架构约束。通过对训练有素的语言模型进行经验分析,我们发现注意力质量集中于一个特定的拓扑流形——且可在不检查每个位置的情况下动态识别该流形。我们证明了一个通用结果:对于任意查询,将注意力投影到压缩流形(锚点 + 窗口 + 动态 Top-k)可实现对全注意力 O(n2)O(n^2) 的 100% 输出等价。这并非近似——它是无损的等价性。我们在 GPT-2、Pythia、Qwen2、TinyLlama 和 Mistral 上进行验证,展示了在 1500 多生成 token 上实现位精确的 token 匹配。在将该拓扑映射到硬件方面,我们的拓扑注意力内核实现了在 131K token(3.94ms vs 628ms)下的 159 倍测量加速,在 1M token 时预计可实现 >1200 倍加速,将推理成本较 Flash Attention 降低超过 99.9%。我们得出结论,二次型瓶颈是朴素实现的副产品,而非智能本身。

关键词

引用

@article{arxiv.2602.06317,
  title  = {The Condensate Theorem: Transformers are O(n), Not $O(n^2)$},
  author = {Jorge L. Ruiz Williams},
  journal= {arXiv preprint arXiv:2602.06317},
  year   = {2026}
}

备注

13 pages, 4 figures, 8 tables, 1 pseudocode algorithm