中文

构建基于稀疏门控专家混合的优异多语言教师模型用于语音识别

计算与语言 2022-01-05 v3 人工智能 机器学习 音频与语音处理

摘要

稀疏门控专家混合(MoE)能以极小的计算复杂度放大网络容量。本工作中,我们探究如何通过简单路由算法扩展多语言自动语音识别(ASR)网络以获取更高准确率。更具体地,我们将稀疏门控 MoE 技术应用于两类网络:序列到序列 Transformer(S2S-T)与 Transformer Transducer(T-T)。我们通过多语言数据上的一组 ASR 实验证明,MoE 网络可分别使 S2S-T 与 T-T 的相对词错率降低 16.3% 与 4.6%。此外,我们深入探究了 MoE 在各种条件下对 T-T 架构的影响:流式模式、非流式模式、语言 ID 的使用,以及带 MoE 的标签解码器。

关键词

引用

@article{arxiv.2112.05820,
  title  = {Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition},
  author = {Kenichi Kumatani and Robert Gmyr and Felipe Cruz Salinas and Linquan Liu and Wei Zuo and Devang Patel and Eric Sun and Yu Shi},
  journal= {arXiv preprint arXiv:2112.05820},
  year   = {2022}
}