自注意力作为吸引子网络:无需反向传播的暂态记忆
机器学习
2024-09-25 v1 无序系统与神经网络
摘要
Transformer 是现代神经网络最成功的架构之一。其核心是所谓的注意力机制,该机制最近引起了物理学界的关注,因为在某些情况下,可以将其表示为能量函数导数的形式:虽然可以将交叉注意力层表示为现代 Hopfield 网络,但自注意力(用于 GPT 架构及其他自回归模型)却无法如此表示。在本工作中,我们展示了可以将自注意力层表示为局部能量项导数,这些能量项类似于伪似然。我们利用与伪似然的类比,设计了一个可在无需反向传播的情况下训练的循环模型:该模型的动力学显示出与训练集和测试集都强烈相关的暂态状态。总体而言,我们提出了一种新框架,将自注意力解释为吸引子网络,为从物理学启发的新理论方法铺平了道路,以理解 Transformer。
关键词
引用
@article{arxiv.2409.16112,
title = {Self-attention as an attractor network: transient memories without backpropagation},
author = {Francesco D'Amico and Matteo Negri},
journal= {arXiv preprint arXiv:2409.16112},
year = {2024}
}