通过对称感知Taylor近似实现每token常数成本的自注意力
机器学习
2026-02-03 v1 人工智能
分布式、并行与集群计算
摘要
当今最广泛使用的人工智能模型是采用自注意力机制的Transformer。在其标准形式下,自注意力的计算成本随上下文长度而增长,推动存储、计算和能源需求的增长,已超过社会提供能力。为此,我们表明,自注意力以任意精度可被有效计算,每token的成本恒定,显著降低内存使用和计算需求。我们通过将常规公式的Taylor展开分解为张量积的对称链表达式来推导我们的公式。我们利用其对称性,获得一种高效将查询和键映射到最小多项式核特征基座的坐标的前馈转换。值得注意的是,成本以头大小的倒数固定,使我们能够在每token上应用更多头数。我们实现了该公式并经验验证了其正确性。我们的工作使无限token生成在 modest 固定成本下成为可能,显著降低大型Transformer模型的基础设施和能源需求。我们引入的数学技术具有独立的兴趣。
引用
@article{arxiv.2602.00294,
title = {Self-Attention at Constant Cost per Token via Symmetry-Aware Taylor Approximation},
author = {Franz A. Heinsen and Leo Kozachkov},
journal= {arXiv preprint arXiv:2602.00294},
year = {2026}
}
备注
For source code and replication instructions, see https://github.com/glassroom/sata_attention. 12 pages, 6 figures (main); 4 pages, 2 figures (appendix)