稀疏混合器:结合 MoE 与混合机制构建更高效的 BERT
机器学习
2022-10-14 v2 计算与语言
摘要
我们将稀疏门控专家混合(Mixture-of-Experts, MoE)的容量与线性混合变换的速度和稳定性相结合,设计了 Sparse Mixer 编码器模型。Sparse Mixer 在 GLUE 和 SuperGLUE 上的表现略优于(<1%) BERT,但更重要的是其训练速度快 65%,推理速度快 61%。我们还提出了一种更快的变体,平实地命名为 Fast Sparse Mixer,它在 SuperGLUE 上的表现略逊于 BERT,但训练和推理速度几乎快一倍。我们通过仔细消融各种混合机制、MoE 配置和超参数来论证这两种模型的设计。Sparse Mixer 克服了 MoE 模型的许多延迟和稳定性问题,并提供了部署稀疏学生模型的前景,而无需将其蒸馏为稠密变体。
引用
@article{arxiv.2205.12399,
title = {Sparse Mixers: Combining MoE and Mixing to build a more efficient BERT},
author = {James Lee-Thorp and Joshua Ainslie},
journal= {arXiv preprint arXiv:2205.12399},
year = {2022}
}