推进用于语音识别的 RNN 转导器技术
计算与语言
2021-03-19 v1 声音
音频与语音处理
摘要
我们研究了一系列对 RNN 转导器(RNN-Ts)行之有效的技术,这些技术有助于在三个不同任务(Switchboard 300 小时、西班牙语对话 780 小时和意大利语对话 900 小时)上降低词错误率。这些技术涉及架构改变、说话人自适应、语言模型融合、模型组合以及通用训练方案。首先,我们在联合网络中引入了编码器与预测网络向量的新型乘法积分(而非加法)。其次,我们讨论了 i-vector 说话人自适应与数据扰动的结合在 RNN-Ts 上的适用性。第三,我们探究了近期提出的密度比语言模型融合在这些任务上的有效性。最后但同样重要的是,我们描述了训练方案的其他组成部分及其对识别性能的影响。我们报告了在 NIST Hub5 2000 评估的 Switchboard 和 CallHome 测试集上分别为 5.9% 和 12.5% 的词错误率,以及在 Mozilla CommonVoice 意大利语测试集上 12.7% 的 WER。
引用
@article{arxiv.2103.09935,
title = {Advancing RNN Transducer Technology for Speech Recognition},
author = {George Saon and Zoltan Tueske and Daniel Bolanos and Brian Kingsbury},
journal= {arXiv preprint arXiv:2103.09935},
year = {2021}
}
备注
Accepted at ICASSP 2021