中文

推进用于语音识别的 RNN 转导器技术

计算与语言 2021-03-19 v1 声音 音频与语音处理

摘要

我们研究了一系列对 RNN 转导器(RNN-Ts)行之有效的技术,这些技术有助于在三个不同任务(Switchboard 300 小时、西班牙语对话 780 小时和意大利语对话 900 小时)上降低词错误率。这些技术涉及架构改变、说话人自适应、语言模型融合、模型组合以及通用训练方案。首先,我们在联合网络中引入了编码器与预测网络向量的新型乘法积分(而非加法)。其次,我们讨论了 i-vector 说话人自适应与数据扰动的结合在 RNN-Ts 上的适用性。第三,我们探究了近期提出的密度比语言模型融合在这些任务上的有效性。最后但同样重要的是,我们描述了训练方案的其他组成部分及其对识别性能的影响。我们报告了在 NIST Hub5 2000 评估的 Switchboard 和 CallHome 测试集上分别为 5.9% 和 12.5% 的词错误率,以及在 Mozilla CommonVoice 意大利语测试集上 12.7% 的 WER。

关键词

引用

@article{arxiv.2103.09935,
  title  = {Advancing RNN Transducer Technology for Speech Recognition},
  author = {George Saon and Zoltan Tueske and Daniel Bolanos and Brian Kingsbury},
  journal= {arXiv preprint arXiv:2103.09935},
  year   = {2021}
}

备注

Accepted at ICASSP 2021