SpeechMoE2:具有改进路由机制的混合专家模型
音频与语音处理
2021-11-24 v1 计算与语言
声音
摘要
基于混合专家且带动态路由机制的声学模型已在语音识别中展现出有前景的结果。路由器架构的设计原则对于大模型容量与高计算效率十分重要。我们此前的工作 SpeechMoE 仅利用局部音素嵌入来帮助路由器做出路由决策。为进一步提升针对不同域与口音的语音识别性能,我们提出了一种新路由器架构,将额外的全局域与口音嵌入整合进路由器输入以增强适应性。实验结果表明,所提出的 SpeechMoE2 在多域与多口音任务上以可比参数量取得了比 SpeechMoE 更低的字符错误率(CER)。具体而言,该方法在多域任务上实现了最高 1.6%–4.8% 的相对 CER 提升,在多口音任务上实现了最高 1.9%–17.7% 的相对 CER 提升。此外,增加专家数量也能带来一致的性能提升,并保持计算成本不变。
引用
@article{arxiv.2111.11831,
title = {SpeechMoE2: Mixture-of-Experts Model with Improved Routing},
author = {Zhao You and Shulin Feng and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2111.11831},
year = {2021}
}
备注
5 pages, 1 figure. Submitted to ICASSP 2022