扩散与注意力的联系
机器学习
2026-04-14 v1
摘要
Transformer、扩散映射和磁拉普拉斯算子通常被视为独立的工具;我们证明它们都是从 softmax 前的查询-分数构建的单一马尔可夫几何的不同机制。我们定义了一个 QK “双散度”,其指数化和归一化形式可产生注意力、扩散映射和磁扩散。并利用专家乘积和薛定谔桥将它们连接并组织成平衡态、非平衡稳态和驱动动力学。
引用
@article{arxiv.2604.09560,
title = {The Diffusion-Attention Connection},
author = {Julio Candanedo},
journal= {arXiv preprint arXiv:2604.09560},
year = {2026}
}