注意力并非关键:基于Grassmann流的无注意力架构
机器学习
2025-12-23 v1 人工智能
代数几何
摘要
我们重访序列建模中的一个基本问题:显式自注意力是否真的必要才能实现卓越的性能和推理能力?我们认为,标准的多头注意力最好看作一种张量升力形式:隐藏向量被映射到成对相互作用的高维空间,通过梯度下降来约束这种升力张量。这种机制极具表达力,但在数学上晦涩难懂,因为经过多层后,若要用小族群的显式不变量来描述模型,几乎不可能。为探索替代方案,我们提出一种基于Grassmann流的无注意力架构。我们的因果Grassmann层(i)线性降低token状态,(ii)通过Plücker坐标将局部token对编码为Grassmann流形上的二维子空间,(iii)通过门控混合将这些几何特征重新融合回隐藏状态。因此,信息通过低秩子空间在多尺度局部窗口上的受控形变来传播,核心计算驻留在有限维流形上,而非在非结构化的张量空间中。在Wikitext-2语言建模基准上,纯Grassmann模型(参数量在1300万至1800万之间)的验证困惑度仅高出规模匹配的Transformer约10%至15%。在SNLI自然语言推理任务上,Grassmann-Plücker头叠加在DistilBERT之上略胜于Transformer头,分别实现最佳验证和测试准确率0.8550和0.8538,与Transformer的0.8545和0.8511相比。我们分析了Grassmann混合的复杂度,证明在固定秩下序列长度的线性扩展,并论证此类流形设计为神经推理提供了更结构化的、基于几何和不变量的解释之路。
引用
@article{arxiv.2512.19428,
title = {Attention Is Not What You Need},
author = {Zhang Chong},
journal= {arXiv preprint arXiv:2512.19428},
year = {2025}
}