中文

自注意力作为吸引子网络:无需反向传播的暂态记忆

机器学习 2024-09-25 v1 无序系统与神经网络

摘要

Transformer 是现代神经网络最成功的架构之一。其核心是所谓的注意力机制,该机制最近引起了物理学界的关注,因为在某些情况下,可以将其表示为能量函数导数的形式:虽然可以将交叉注意力层表示为现代 Hopfield 网络,但自注意力(用于 GPT 架构及其他自回归模型)却无法如此表示。在本工作中,我们展示了可以将自注意力层表示为局部能量项导数,这些能量项类似于伪似然。我们利用与伪似然的类比,设计了一个可在无需反向传播的情况下训练的循环模型:该模型的动力学显示出与训练集和测试集都强烈相关的暂态状态。总体而言,我们提出了一种新框架,将自注意力解释为吸引子网络,为从物理学启发的新理论方法铺平了道路,以理解 Transformer。

关键词

引用

@article{arxiv.2409.16112,
  title  = {Self-attention as an attractor network: transient memories without backpropagation},
  author = {Francesco D'Amico and Matteo Negri},
  journal= {arXiv preprint arXiv:2409.16112},
  year   = {2024}
}