带层归一化的Transformer自注意力动力学中均值场模型的分析
偏微分方程分析
2025-04-29 v2
摘要
本文旨在对采用带有层归一化的自注意力机制的Transformer架构进行数学分析。特别是,观察到此类架构呈现出类似于簇集或均匀分布的模式,这提出了一系列具有挑战性的数学问题。我们聚焦于一种可在单位球面概率测度空间中以特殊度量形式梯度流的情形,这使我们能够以严谨方式给出至少部分答案。所涉及的数学问题类似于最近研究的聚合方程,但额外的挑战源于将动力学限制在球面上以及特定的相互作用能形式。我们提供了用于研究梯度流的严格框架,这还建议了一种可能的度量几何来研究一般情况(即不描述为梯度流的情况)。我们进一步分析了诱导的自注意力动力学的平稳点。后者与 Wasserstein 几何中相互作用能的平稳点有关,我们进一步讨论了在不同参数设置下能量最小化者和最大化者。
关键词
引用
@article{arxiv.2501.03096,
title = {Analysis of mean-field models arising from self-attention dynamics in transformer architectures with layer normalization},
author = {Martin Burger and Samira Kabri and Yury Korolev and Tim Roith and Lukas Weigand},
journal= {arXiv preprint arXiv:2501.03096},
year = {2025}
}
备注
46 pages, 7 figures