混合线性-全注意力中的可证明表达层级
机器学习
2026-02-03 v1 人工智能
计算复杂性
摘要
Transformer 是大多数现代大型语言模型的基础。为缓解标准全注意力的二次复杂度,各种高效注意力机制(如线性注意力和混合注意力)相继开发出来。仍存一个根本性差距:它们的表达能力相对于全注意力缺乏严格的理论描述。本文对这些注意力机制的性能差异进行理论阐述。我们的理论适用于所有可形式化为 recurrence 的线性注意力变体,包括 Mamba、DeltaNet 等。具体而言,我们建立了表达层级:对于必须在模型前向传播中完成的序列函数 composition 多步推理任务,一个 () 层的全注意力网络足以解决它,而任何在 层全注意力层与约 个线性注意力层交错的混合网络无法解决。该结果表明了两种注意力类型之间表达能力的明确分离。我们的工作为理解不同注意力机制的根本能力与局限性提供了首个可证明的混合注意力与标准全注意力之间的分离。
引用
@article{arxiv.2602.01763,
title = {A Provable Expressiveness Hierarchy in Hybrid Linear-Full Attention},
author = {Xiaowei Ye and Xiaoyu He and Chao Liao and Chen Wu and Pinyan Lu},
journal= {arXiv preprint arXiv:2602.01763},
year = {2026}
}