3M:用于语音识别的多损失、多路径与多层次神经网络
声音
2022-04-15 v2 计算与语言
音频与语音处理
摘要
近来,基于 Conformer 的 CTC/AED 模型已成为 ASR 的主流架构。本文在我们先前工作的基础上,识别并整合了若干方法以在 ASR 任务上取得进一步提升,我们将其记为多损失、多路径和多层次,概括为“3M”模型。具体而言,多损失指联合 CTC/AED 损失,多路径表示专家混合(MoE)架构,其可在不显著增加计算成本的情况下有效提升模型容量。多层次指我们在深层模型的多个层级引入辅助损失以辅助训练。我们在公开的 WenetSpeech 数据集上评估了所提方法,实验结果显示相较 Wenet 工具包训练的基线模型,该方法带来了 12.2%–17.6% 的相对 CER 提升。在我们 15 万小时的大规模语料数据集上,3M 模型也展现出相对于基线 Conformer 模型的明显优势。代码已公开于 https://github.com/tencent-ailab/3m-asr。
引用
@article{arxiv.2204.03178,
title = {3M: Multi-loss, Multi-path and Multi-level Neural Networks for speech recognition},
author = {Zhao You and Shulin Feng and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2204.03178},
year = {2022}
}
备注
5 pages, 1 figure. Submitted to INTERSPEECH 2022