中文

用于流式多语言语音识别的专家混合Conformer

计算与语言 2023-05-26 v1 声音 音频与语音处理

摘要

具有大容量的端到端模型显著改善了多语言自动语音识别,但其计算成本对端侧应用构成挑战。我们提出一种流式真正多语言Conformer,其融入专家混合(MoE)层,该层在训练与推理中学习仅激活部分参数。MoE层由一个softmax门组成,在前向传播中从多个专家里选择最优的两个。所提MoE层随着专家数量增加,通过激活固定数量的参数实现高效推理。我们在12种语言上评估所提模型,相较基线在词错率(WER)上取得平均11.9%的相对提升。与使用真实语言信息的适配器模型相比,我们的MoE模型取得了相近的WER并激活了相近数量的参数,但无需任何语言信息。我们进一步通过多语言浅融合取得了约3%的相对WER提升。

关键词

引用

@article{arxiv.2305.15663,
  title  = {Mixture-of-Expert Conformer for Streaming Multilingual ASR},
  author = {Ke Hu and Bo Li and Tara N. Sainath and Yu Zhang and Francoise Beaufays},
  journal= {arXiv preprint arXiv:2305.15663},
  year   = {2023}
}

备注

Accepted to Interspeech 2023