SpeechMoE:基于动态路由专家混合扩展至大型声学模型
声音
2021-05-10 v1 计算与语言
音频与语音处理
摘要
近来,基于专家混合(MoE)的 Transformer 已在诸多领域展现出有前景的结果。这很大程度上归功于该架构的以下优势:首先,基于 MoE 的 Transformer 可在训练与推理时均不增加计算成本的情况下提升模型容量。此外,基于 MoE 的 Transformer 是一种动态网络,可适应真实应用中输入实例复杂度的变化。本工作中,我们探索用于语音识别的基于 MoE 的模型,称为 SpeechMoE。为进一步控制路由激活的稀疏性并提升门值的多样性,我们分别提出了稀疏性 L1 损失与平均重要性损失。此外,SpeechMoE 采用了一种新的路由架构,可同时利用来自共享嵌入网络的信息以及不同 MoE 层的层次化表示。实验结果表明,SpeechMoE 能以与传统静态网络相当的计算成本实现更低的字符错误率(CER),在四个评测数据集上带来 7.0%–23.0% 的相对 CER 提升。
引用
@article{arxiv.2105.03036,
title = {SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts},
author = {Zhao You and Shulin Feng and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2105.03036},
year = {2021}
}
备注
5 pages, 2 figures. Submitted to Interspeech 2021