Strassen 注意力、分裂 VC 维度与 Transformer 的组合性
机器学习
2025-09-26 v3 人工智能
摘要
我们提出了第一种方法,以展示具有任意多精度位(甚至是无限精度)的单层 softmax Transformer 的理论局限性。我们针对三个需要高级推理的任务确立了这些局限性。第一个任务是 Match 3 (Sanford et al., 2023),要求查看输入序列中所有可能的 token 三元组。第二和第三个任务涉及基于组合性的推理:分别是函数组合 (Peng et al., 2024) 和二元关系组合。我们正式证明了单层 softmax Transformer 无法解决这些任务中的任何一个。为了克服这些局限性,我们引入了 Strassen 注意力,并证明了配备该机制后,单层 Transformer 原则上可以解决所有这些任务。重要的是,我们证明了它具有亚立方运行时间复杂度,使其比先前提出的类似机制(如高阶注意力 (Sanford et al., 2023))更具可扩展性。为了补充我们的理论发现,我们对 Strassen 注意力进行了实验研究,并将其与标准注意力 (Vaswani et al, 2017)、高阶注意力 (Sanford et al., 2023) 和三角注意力 (Bergen et al. 2021) 进行了比较。我们的结果有助于厘清所有这些注意力机制,突出了它们的优势和局限性。特别是,Strassen 注意力在所有任务上都显著优于标准注意力。总而言之,理解理论局限性可以引导研究走向可扩展的注意力机制,从而提升 Transformer 的推理能力。
引用
@article{arxiv.2501.19215,
title = {Strassen Attention, Split VC Dimension and Compositionality in Transformers},
author = {Alexander Kozachinskiy and Felipe Urrutia and Hector Jimenez and Tomasz Steifer and Germán Pizarro and Matías Fuentes and Francisco Meza and Cristian B. Calderon and Cristóbal Rojas},
journal= {arXiv preprint arXiv:2501.19215},
year = {2025}
}
备注
Accepted at NeurIPS 2025