用归一化联合网络改进 RNN 转导器
音频与语音处理
2020-11-04 v1 声音
摘要
循环神经转导器(RNN-T)是自动语音识别(ASR)中一种有前景的端到端(E2E)模型。相比传统混合 ASR 系统,它展现出更优性能。然而,从零训练 RNN-T 仍具挑战性。我们观察到 RNN-T 训练期间存在巨大梯度方差,并怀疑其损害性能。本工作中,我们分析了 RNN-T 训练中巨大梯度方差的成因,并提出了新的\textit{归一化联合网络}以克服它。我们还提议用改进的 conformer 编码器网络和 transformer-XL 预测网络增强 RNN-T 网络以达到最佳性能。实验在开放的 170 小时 AISHELL-1 和工业级 30000 小时普通话语音数据集上进行。在 AISHELL-1 数据集上,我们的 RNN-T 系统在流式与非流式基准上分别取得 CER 6.15\% 和 5.37\% 的 SOTA 结果。我们进一步在 30000 小时工业音频数据上将 RNN-T 系统与训练良好的商业混合系统比较,在无预训练或外部语言模型下取得 9\% 相对提升。
引用
@article{arxiv.2011.01576,
title = {Improving RNN transducer with normalized jointer network},
author = {Mingkun Huang and Jun Zhang and Meng Cai and Yang Zhang and Jiali Yao and Yongbin You and Yi He and Zejun Ma},
journal= {arXiv preprint arXiv:2011.01576},
year = {2020}
}