从自注意力到连接拉普拉斯算子:Transformer的统一算子视角
机器学习
2026-07-12 v1 计算与语言
摘要
自注意力是现代序列模型中普遍存在的基本原语,但其算子层面的几何结构仅被部分理解。我们将令牌序列视为令牌位置图上的向量场,并将注意力识别为连接游走:消息通过非负游走矩阵聚合,同时沿每条边由学习到的线性映射进行传输。在此框架内,我们证明了单头注意力(SHA)恰好是具有恒定传输的连接传播步骤,而多头注意力(MHA)恰好是单次边依赖的连接游走,其有效传输是注意力门控的头向传输混合。我们进一步阐明了相应生成器简化为随机游走连接拉普拉斯算子的条件,强调了随机性、可逆性和度量兼容传输的作用。在实证中,我们发现跨规模(从124M到8B)和结构(编码器/解码器)训练好的Transformer表现出与我们的理论一致的几何结构:有效注意力图在更深层收敛到稳定的几何算子,学习到的传输自组织成近似缩放等距,并且这两种现象都随规模一致增强。总的来说,本文提供了一个精确的连接游走形式体系,将自注意力与经典几何算子联系起来,并为一组从几何角度分析Transformer模型的算子级工具。
关键词
引用
@article{arxiv.2607.10677,
title = {From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers},
author = {Binbin Lin and Wei Chen and Yalun Li and Wenxiao Wang and Jieping Ye and Xiaofei He},
journal= {arXiv preprint arXiv:2607.10677},
year = {2026}
}
备注
29 pages, 10 figures