中文

侧向化 MLP:一种面向扩散任务的简约脑类架构

计算机视觉与模式识别 2024-05-28 v1

摘要

Transformer 架构在广泛的任务中主导了机器学习领域。其特定特征是代价高昂的缩放点积注意力机制,建模 token 之间的相互作用,这已知是其成功背后的原因。然而,这种机制没有人脑的直接类比,这引出了一个问题:在表现能力强的智能体中,是否真的需要缩放点积注意力机制。灵感来自人脑的侧向化,我们提出了一种简单而有效的新型架构,称为侧向化 MLP(L-MLP)。叠加 L-MLP 模块可生成复杂的网络结构。每个 L-MLP 模块基于多层感知器(MLP),对数据维度进行置换,分别在每个维度上并行处理,然后进行合并,最终通过一个联合 MLP。我们发现,这一特定设计在其他 MLP 变体中表现优异, 在具有挑战性的扩散任务中,性能与基于 Transformer 的架构相当,同时具有高度的效率。我们使用文本到图像生成任务进行实验,以展示 L-MLP 的有效性与效率。进一步地,我们分析了模型行为,发现其功能与人脑的作用存在关联。我们的代码已公开:https://github.com/zizhao-hu/L-MLP

关键词

引用

@article{arxiv.2405.16098,
  title  = {Lateralization MLP: A Simple Brain-inspired Architecture for Diffusion},
  author = {Zizhao Hu and Mohammad Rostami},
  journal= {arXiv preprint arXiv:2405.16098},
  year   = {2024}
}