层次关联记忆、并行化 MLP-Mixer 以及对称性破缺
机器学习
2024-06-19 v1 无序系统与神经网络
计算机视觉与模式识别
神经与进化计算
机器学习
摘要
Transformer 已在自然语言处理领域确立 themselves as 领先的神经网络模型,并在各类领域日益成为基础模型。在视觉领域,MLP-Mixer 模型展现了竞争性能,表明注意力机制可能并非必不可少。鼓舞此思路,近期研究探索用其他机制替代注意力模块,包括 MetaFormers 描述的机制。然而,这些模型的理论框架仍不成熟。本文提出新视角,通过将 Krotov 的层次关联记忆与 MetaFormers 集成,使整个 Transformer 块(包括 token-混合和 channel-混合模块、层归一化和跨层连接)作为单个 Hopfield 网络的完整表征。该方法产生一个来自三层 Hopfield 网络的并行化 MLP-Mixer,自然包含对称的 token-和 channel-混合模块以及层归一化。实证研究表明,模型中的对称交互矩阵会阻碍图像识别任务的性能。引入对称性破缺效应后,模型性能从对称并行化 MLP-Mixer 转为 vanilla MLP-Mixer。这表明在标准训练中,vanilla MLP-Mixer 的权重矩阵会自发获得对称性破缺配置,从而提升其效果。这些发现为理解 Transformer 和 MLP-Mixer 的内在属性及其理论基础提供了洞见,为未来模型设计和优化提供了稳健框架。
引用
@article{arxiv.2406.12220,
title = {Hierarchical Associative Memory, Parallelized MLP-Mixer, and Symmetry Breaking},
author = {Ryo Karakida and Toshihiro Ota and Masato Taki},
journal= {arXiv preprint arXiv:2406.12220},
year = {2024}
}
备注
18 pages