用随机专家驯服稀疏激活 Transformer
计算与语言
2022-02-07 v3 机器学习
摘要
稀疏激活模型(SAMs),如混合专家(MoE),可以轻松扩展到具有极大规模的参数量,而计算成本不会显著增加。然而,据报道 SAMs 存在参数效率低的问题,即更大的模型并不总是带来更好的性能。虽然大多数正在进行的研究侧重于通过探索将输入路由到专家的方法来改进 SAMs 模型,但我们的分析表明此类研究可能不会导致我们预期的解决方案,即常用的基于门控机制的路由方法并不比将输入随机路由到专家效果更好。在本文中,我们提出了一种新的基于专家的模型 THOR(Transformer witH StOchastic ExpeRts,带随机专家的 Transformer)。与经典的基于专家的模型(如 Switch Transformer)不同,THOR 中的专家在训练和推理期间对每个输入都是随机激活的。THOR 模型使用一致性正则化损失进行训练,其中专家不仅从训练数据中学习,还从其他专家作为教师中学习,使得所有专家做出一致的预测。我们在机器翻译任务上验证了 THOR 的有效性。结果表明,THOR 模型具有更高的参数效率,在各种设置下均显著优于 Transformer 和 MoE 模型。例如,在多语言翻译中,THOR 比 Switch Transformer 高出 2 个 BLEU 分数,并获得了比其大 18 倍的最先进 MoE 模型相同的 BLEU 分数。我们的代码公开于:https://github.com/microsoft/Stochastic-Mixture-of-Experts。
引用
@article{arxiv.2110.04260,
title = {Taming Sparsely Activated Transformer with Stochastic Experts},
author = {Simiao Zuo and Xiaodong Liu and Jian Jiao and Young Jin Kim and Hany Hassan and Ruofei Zhang and Tuo Zhao and Jianfeng Gao},
journal= {arXiv preprint arXiv:2110.04260},
year = {2022}
}
备注
ICLR 2022