构建基于稀疏门控专家混合的优异多语言教师模型用于语音识别
计算与语言
2022-01-05 v3 人工智能
机器学习
音频与语音处理
摘要
稀疏门控专家混合(MoE)能以极小的计算复杂度放大网络容量。本工作中,我们探究如何通过简单路由算法扩展多语言自动语音识别(ASR)网络以获取更高准确率。更具体地,我们将稀疏门控 MoE 技术应用于两类网络:序列到序列 Transformer(S2S-T)与 Transformer Transducer(T-T)。我们通过多语言数据上的一组 ASR 实验证明,MoE 网络可分别使 S2S-T 与 T-T 的相对词错率降低 16.3% 与 4.6%。此外,我们深入探究了 MoE 在各种条件下对 T-T 架构的影响:流式模式、非流式模式、语言 ID 的使用,以及带 MoE 的标签解码器。
引用
@article{arxiv.2112.05820,
title = {Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition},
author = {Kenichi Kumatani and Robert Gmyr and Felipe Cruz Salinas and Linquan Liu and Wei Zuo and Devang Patel and Eric Sun and Yu Shi},
journal= {arXiv preprint arXiv:2112.05820},
year = {2022}
}