中文

层次关联记忆、并行化 MLP-Mixer 以及对称性破缺

机器学习 2024-06-19 v1 无序系统与神经网络 计算机视觉与模式识别 神经与进化计算 机器学习

摘要

Transformer 已在自然语言处理领域确立 themselves as 领先的神经网络模型,并在各类领域日益成为基础模型。在视觉领域,MLP-Mixer 模型展现了竞争性能,表明注意力机制可能并非必不可少。鼓舞此思路,近期研究探索用其他机制替代注意力模块,包括 MetaFormers 描述的机制。然而,这些模型的理论框架仍不成熟。本文提出新视角,通过将 Krotov 的层次关联记忆与 MetaFormers 集成,使整个 Transformer 块(包括 token-混合和 channel-混合模块、层归一化和跨层连接)作为单个 Hopfield 网络的完整表征。该方法产生一个来自三层 Hopfield 网络的并行化 MLP-Mixer,自然包含对称的 token-和 channel-混合模块以及层归一化。实证研究表明,模型中的对称交互矩阵会阻碍图像识别任务的性能。引入对称性破缺效应后,模型性能从对称并行化 MLP-Mixer 转为 vanilla MLP-Mixer。这表明在标准训练中,vanilla MLP-Mixer 的权重矩阵会自发获得对称性破缺配置,从而提升其效果。这些发现为理解 Transformer 和 MLP-Mixer 的内在属性及其理论基础提供了洞见,为未来模型设计和优化提供了稳健框架。

关键词

引用

@article{arxiv.2406.12220,
  title  = {Hierarchical Associative Memory, Parallelized MLP-Mixer, and Symmetry Breaking},
  author = {Ryo Karakida and Toshihiro Ota and Masato Taki},
  journal= {arXiv preprint arXiv:2406.12220},
  year   = {2024}
}

备注

18 pages