中文

Transformer 与 MLP-Mixer:面向 NLP 问题的指数级表达能力差距

计算与语言 2022-11-18 v3 计算机视觉与模式识别 机器学习

摘要

Vision-Transformer 被广泛应用于各种视觉任务。与此同时,另一条始于 MLP-Mixer 的研究路线试图使用基于 MLP 的架构来实现相似性能。有趣的是,迄今为止这些基于 MLP 的架构尚未被适配到 NLP 任务中。此外,直到现在,基于 MLP 的架构在视觉任务中也未能达到最先进(state-of-the-art)性能。在本文中,我们分析了基于 MLP 的架构在同时建模多个不同输入之间依赖关系上的表达能力,并展示了注意力机制与基于 MLP 的机制之间的指数级差距。我们的结果从理论上解释了 MLP 无法在 NLP 问题中与基于注意力的机制竞争的原因,它们也表明视觉任务中的性能差距可能源于 MLP 在建模多个不同位置之间依赖关系上的相对弱势,并且将智能输入排列与 MLP 架构相结合可能不足以单独弥补性能差距。

关键词

引用

@article{arxiv.2208.08191,
  title  = {Transformer Vs. MLP-Mixer: Exponential Expressive Gap For NLP Problems},
  author = {Dan Navon and Alex M. Bronstein},
  journal= {arXiv preprint arXiv:2208.08191},
  year   = {2022}
}