关注 MLP
机器学习
2021-06-03 v2 计算与语言
计算机视觉与模式识别
摘要
Transformer 已成为深度学习中最重要的架构创新之一,并在过去几年中促成了许多突破。这里我们提出一种简单的网络架构 gMLP,基于带门控的 MLP,并展示其在关键的语言和视觉应用中可以表现得与 Transformer 一样好。我们的比较表明,自注意力对 Vision Transformer 并非关键,因为 gMLP 可以达到相同的准确率。对于 BERT,我们的模型在预训练困惑度上与 Transformer 持平,并在一些下游 NLP 任务上更优。在 gMLP 表现较差的微调任务上,将 gMLP 模型显著增大可以缩小与 Transformer 的差距。总体而言,我们的实验表明 gMLP 可以随数据和计算的增加与 Transformer 一样好地扩展。
引用
@article{arxiv.2105.08050,
title = {Pay Attention to MLPs},
author = {Hanxiao Liu and Zihang Dai and David R. So and Quoc V. Le},
journal= {arXiv preprint arXiv:2105.08050},
year = {2021}
}