中文

基于稀疏全 MLP 的高效语言建模

计算与语言 2022-06-02 v3 人工智能

摘要

全 MLP 架构作为基于注意力模型的替代方案已引起越来越多的关注。在 NLP 中,近期如 gMLP 的工作表明全 MLP 在语言建模上可匹敌 Transformer,但在下游任务上仍落后。本工作中,我们分析 MLP 在表达能力上的局限,并提出在特征与输入(词元)维度上均使用混合专家(MoEs)的稀疏激活 MLP。此类稀疏全 MLP 在保持计算量不变的同时显著提升模型容量与表达能力。我们通过两种路由策略解决条件计算引入的关键挑战。所提稀疏全 MLP 改善了语言建模困惑度,并与基于 Transformer 的 MoE(GShard、Switch Transformer、Base Layers 与 HASH Layers)以及稠密 Transformer 和全 MLP 相比,训练效率最高提升 2×\times。最后,我们在六个下游任务上评估其零样本上下文学习性能,发现其超越基于 Transformer 的 MoE 与稠密 Transformer。

关键词

引用

@article{arxiv.2203.06850,
  title  = {Efficient Language Modeling with Sparse all-MLP},
  author = {Ping Yu and Mikel Artetxe and Myle Ott and Sam Shleifer and Hongyu Gong and Ves Stoyanov and Xian Li},
  journal= {arXiv preprint arXiv:2203.06850},
  year   = {2022}
}