中文

3M:用于语音识别的多损失、多路径与多层次神经网络

声音 2022-04-15 v2 计算与语言 音频与语音处理

摘要

近来,基于 Conformer 的 CTC/AED 模型已成为 ASR 的主流架构。本文在我们先前工作的基础上,识别并整合了若干方法以在 ASR 任务上取得进一步提升,我们将其记为多损失、多路径和多层次,概括为“3M”模型。具体而言,多损失指联合 CTC/AED 损失,多路径表示专家混合(MoE)架构,其可在不显著增加计算成本的情况下有效提升模型容量。多层次指我们在深层模型的多个层级引入辅助损失以辅助训练。我们在公开的 WenetSpeech 数据集上评估了所提方法,实验结果显示相较 Wenet 工具包训练的基线模型,该方法带来了 12.2%–17.6% 的相对 CER 提升。在我们 15 万小时的大规模语料数据集上,3M 模型也展现出相对于基线 Conformer 模型的明显优势。代码已公开于 https://github.com/tencent-ailab/3m-asr。

关键词

引用

@article{arxiv.2204.03178,
  title  = {3M: Multi-loss, Multi-path and Multi-level Neural Networks for speech recognition},
  author = {Zhao You and Shulin Feng and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:2204.03178},
  year   = {2022}
}

备注

5 pages, 1 figure. Submitted to INTERSPEECH 2022