变换器作为概率拉普拉斯特征图的展开推断:一种解释与潜在改进
机器学习
2025-07-29 v1 机器学习
摘要
我们提出一种概率解释,将变换器视为假设 ProbDR 框架中概率拉普拉斯特征图模型的展开推断步骤。我们的推导表明,在初始化时,变换器执行“线性”降维。在我们观察到的 transformer 块中,出现一种拉普拉斯算子,而非注意力矩阵(我们将其解释为邻接矩阵)。我们演示,仅通过从注意力矩阵中减去单位矩阵( thereby 采取图扩散一步)即可提高语言模型和简单视觉变换器上的验证性能。
引用
@article{arxiv.2507.21040,
title = {Transformers as Unrolled Inference in Probabilistic Laplacian Eigenmaps: An Interpretation and Potential Improvements},
author = {Aditya Ravuri and Neil D. Lawrence},
journal= {arXiv preprint arXiv:2507.21040},
year = {2025}
}
备注
Initial version