中文

自注意力神经网络的动态均场理论

无序系统与神经网络 2024-06-12 v1 机器学习

摘要

Transformer-based 模型在 diverse 领域 demonstrating of exceptional performance,成为解决序列机器学习问题的 state-of-the-art 解决方案。尽管我们对 transformer 架构的基本组件有一般性理解,但关于它们如何操作以及其预期动力学的了解仍很有限。最近,越来越多的人关注注意力机制与 Hopfield 网络之间的关系,这有望阐明 transformer 网络的统计物理学。然而,迄今为止,尚未深入研究 transformer 类模型的动力学制度。本文通过使用用于研究非平衡体系中非对称 Hopfield 网络的方法来弥补这一空白——即对生成函数的路径积分方法,yield dynamics governed by concurrent mean-field variables。假设 1 位 token 和权重,我们推导出大型自注意力神经网络耦合到 softmax 输出的行为的解析近似,随着规模趋于无穷大变得精确。我们的发现揭示了包括但不限于非平衡相变、混沌分岔等非平凡动力学现象,即使在仅有几个编码特征和非常短的上下文窗口的简单配置下也如此。最后,我们讨论了这种解析方法的潜力,以提高对 transformer 模型内部工作原理的理解,从而可能降低计算训练成本并增强模型的可解释性。

关键词

引用

@article{arxiv.2406.07247,
  title  = {Dynamical Mean-Field Theory of Self-Attention Neural Networks},
  author = {Ángel Poc-López and Miguel Aguilera},
  journal= {arXiv preprint arXiv:2406.07247},
  year   = {2024}
}