中文

关注 MLP

机器学习 2021-06-03 v2 计算与语言 计算机视觉与模式识别

摘要

Transformer 已成为深度学习中最重要的架构创新之一,并在过去几年中促成了许多突破。这里我们提出一种简单的网络架构 gMLP,基于带门控的 MLP,并展示其在关键的语言和视觉应用中可以表现得与 Transformer 一样好。我们的比较表明,自注意力对 Vision Transformer 并非关键,因为 gMLP 可以达到相同的准确率。对于 BERT,我们的模型在预训练困惑度上与 Transformer 持平,并在一些下游 NLP 任务上更优。在 gMLP 表现较差的微调任务上,将 gMLP 模型显著增大可以缩小与 Transformer 的差距。总体而言,我们的实验表明 gMLP 可以随数据和计算的增加与 Transformer 一样好地扩展。

关键词

引用

@article{arxiv.2105.08050,
  title  = {Pay Attention to MLPs},
  author = {Hanxiao Liu and Zihang Dai and David R. So and Quoc V. Le},
  journal= {arXiv preprint arXiv:2105.08050},
  year   = {2021}
}