中文

会话语音识别中实现人类水平相当

计算与语言 2018-12-06 v2 音频与语音处理

摘要

自1990年代Switchboard语料库发布以来,会话语音识别一直是旗舰语音识别任务。本文中,我们测量了广泛使用的NIST 2000测试集上的人类错误率,并发现我们最新的自动化系统已达到人类同等水平。专业转录员对该数据中Switchboard部分(新认识的两人讨论指定话题)的错误率为5.9%,对CallHome部分(朋友和家人进行开放式对话)为11.3%。在这两种情况下,我们的自动化系统确立了新的最先进水平,并略微超过人类基准,分别实现5.8%和11.0%的错误率。我们系统性能的关键在于使用了多种卷积和LSTM声学模型架构,结合一种新颖的空间平滑方法和无网格MMI声学训练、多种循环神经网络语言建模方法,以及系统组合的系统化使用。

关键词

引用

@article{arxiv.1610.05256,
  title  = {Achieving Human Parity in Conversational Speech Recognition},
  author = {W. Xiong and J. Droppo and X. Huang and F. Seide and M. Seltzer and A. Stolcke and D. Yu and G. Zweig},
  journal= {arXiv preprint arXiv:1610.05256},
  year   = {2018}
}

备注

Revised for publication, updated results