中文

论英语会话语音识别的极限

计算与语言 2021-05-04 v1 声音 音频与语音处理

摘要

在我们之前的工作中,我们证明了单头注意力编码器-解码器模型能够在会话语音识别中达到最先进的结果。在本文中,我们进一步改进了 Switchboard 300 和 2000 上的结果。通过使用改进的优化器、说话人向量嵌入和替代语音表示,我们将 LSTM 系统在 Switchboard-300 上的识别错误率相对降低了 4%。利用概率比方法对解码器模型进行补偿,可以更有效地集成外部语言模型,并且我们报告了在 Hub5'00 的 SWB 和 CHM 部分上分别达到 5.9% 和 11.5% 的 WER,使用的是非常简单的 LSTM 模型。我们的研究还考虑了最近提出的 conformer 以及更先进的基于自注意力的语言模型。总体而言,conformer 表现出与 LSTM 相似的性能;然而,它们的组合以及使用改进 LM 的解码在 Switchboard-300 上达到了新的纪录,在 SWB 和 CHM 上分别为 5.0% 和 10.0% 的 WER。我们的发现也在 Switchboard-2000 上得到证实,并报告了新的最先进水平,实际上达到了该基准的极限。

关键词

引用

@article{arxiv.2105.00982,
  title  = {On the limit of English conversational speech recognition},
  author = {Zoltán Tüske and George Saon and Brian Kingsbury},
  journal= {arXiv preprint arXiv:2105.00982},
  year   = {2021}
}