用于流式多语言语音识别的专家混合Conformer
计算与语言
2023-05-26 v1 声音
音频与语音处理
摘要
具有大容量的端到端模型显著改善了多语言自动语音识别,但其计算成本对端侧应用构成挑战。我们提出一种流式真正多语言Conformer,其融入专家混合(MoE)层,该层在训练与推理中学习仅激活部分参数。MoE层由一个softmax门组成,在前向传播中从多个专家里选择最优的两个。所提MoE层随着专家数量增加,通过激活固定数量的参数实现高效推理。我们在12种语言上评估所提模型,相较基线在词错率(WER)上取得平均11.9%的相对提升。与使用真实语言信息的适配器模型相比,我们的MoE模型取得了相近的WER并激活了相近数量的参数,但无需任何语言信息。我们进一步通过多语言浅融合取得了约3%的相对WER提升。
引用
@article{arxiv.2305.15663,
title = {Mixture-of-Expert Conformer for Streaming Multilingual ASR},
author = {Ke Hu and Bo Li and Tara N. Sainath and Yu Zhang and Francoise Beaufays},
journal= {arXiv preprint arXiv:2305.15663},
year = {2023}
}
备注
Accepted to Interspeech 2023