中文

注意力机制到广义 Potts 模型的映射

无序系统与神经网络 2024-04-17 v4 统计力学 计算与语言 机器学习

摘要

Transformer 是革新了自然语言处理和机器学习的神经网络。它们使用称为自注意力(self-attention)的机制处理输入序列(如单词),该机制通过掩码语言建模(MLM)进行训练。在 MLM 中,输入序列中的一个单词被随机掩码,网络被训练来预测缺失的单词。尽管 Transformer 取得了实际成功,但自注意力能有效学习何种类型的数据分布仍不清楚。在此,我们分析表明,如果将单词位置和嵌入的处理解耦,单层自注意力学习的是具有位点间和 Potts 颜色间相互作用的广义 Potts 模型的条件概率。此外,我们表明训练该神经网络完全等价于用统计物理中著名的伪似然方法求解逆 Potts 问题。利用这一映射,我们使用副本法(replica method)在模型情景下解析地计算了自注意力的泛化误差。

关键词

引用

@article{arxiv.2304.07235,
  title  = {Mapping of attention mechanisms to a generalized Potts model},
  author = {Riccardo Rende and Federica Gerace and Alessandro Laio and Sebastian Goldt},
  journal= {arXiv preprint arXiv:2304.07235},
  year   = {2024}
}

备注

5 pages, 3 figures