中文

变换器作为概率拉普拉斯特征图的展开推断:一种解释与潜在改进

机器学习 2025-07-29 v1 机器学习

摘要

我们提出一种概率解释,将变换器视为假设 ProbDR 框架中概率拉普拉斯特征图模型的展开推断步骤。我们的推导表明,在初始化时,变换器执行“线性”降维。在我们观察到的 transformer 块中,出现一种拉普拉斯算子,而非注意力矩阵(我们将其解释为邻接矩阵)。我们演示,仅通过从注意力矩阵中减去单位矩阵( thereby 采取图扩散一步)即可提高语言模型和简单视觉变换器上的验证性能。

关键词

引用

@article{arxiv.2507.21040,
  title  = {Transformers as Unrolled Inference in Probabilistic Laplacian Eigenmaps: An Interpretation and Potential Improvements},
  author = {Aditya Ravuri and Neil D. Lawrence},
  journal= {arXiv preprint arXiv:2507.21040},
  year   = {2025}
}

备注

Initial version