极其庞大的神经网络:稀疏门控混合专家层
机器学习
2017-01-24 v1 计算与语言
神经与进化计算
机器学习
摘要
神经网络吸收信息的能力受限于其参数数量。条件计算(conditional computation)在理论上被提出作为一种在不按比例增加计算量的情况下显著提升模型容量的方法,其中网络的部分结构针对每个样本被激活。然而在实践中,存在显著的算法和性能挑战。在本工作中,我们应对这些挑战,最终实现了条件计算的承诺,在现代GPU集群上以仅微小的计算效率损失获得了超过1000倍的模型容量提升。我们引入了稀疏门控混合专家层(Sparsely-Gated Mixture-of-Experts layer, MoE),其由多达数千个前馈子网络组成。一个可训练的门控网络确定这些专家的一个稀疏组合,用于每个样本。我们将MoE应用于语言建模和机器翻译任务,在这些任务中模型容量对于吸收训练语料中大量的知识至关重要。我们提出了一种模型架构,其中具有多达137 billion参数的MoE被卷积地应用于堆叠的LSTM层之间。在大型语言建模和机器翻译基准上,这些模型以更低的计算成本取得了显著优于最先进水平(state-of-the-art)的结果。
引用
@article{arxiv.1701.06538,
title = {Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer},
author = {Noam Shazeer and Azalia Mirhoseini and Krzysztof Maziarz and Andy Davis and Quoc Le and Geoffrey Hinton and Jeff Dean},
journal= {arXiv preprint arXiv:1701.06538},
year = {2017}
}