中文

CAPIO 2017 对话语音识别系统

计算与语言 2018-04-11 v2

摘要

在本文中,我们展示了如何在工业标准的 NIST 2000 Hub5 英语评测集上取得最先进(state-of-the-art, SOTA)的性能。我们探索了密集连接 LSTM,其灵感来自近期为图像分类任务引入的密集连接卷积网络。我们还提出了一种声学模型自适应方案,简单地对种子神经网络声学模型及其自适应版本的参数取平均。该方法应用于 CallHome 训练语料库,相对于评测集的 CallHome 部分平均提升了 6.1%(相对)的个体系统性能,且在 Switchboard 部分无性能损失。通过对跨三种不同音素集训练的 5 个系统进行 RNN-LM 重打分和词格组合,我们的 2017 语音识别系统在 Switchboard 和 CallHome 上分别取得了 5.0% 和 9.1% 的词错误率,二者均为迄今报道的最佳词错误率。根据 IBM 在其最新比较人类与机器转写的工作中,我们所报道的 Switchboard 词错误率可被认为超越了转写对话电话语音的人类 parity(5.1%)。

关键词

引用

@article{arxiv.1801.00059,
  title  = {The CAPIO 2017 Conversational Speech Recognition System},
  author = {Kyu J. Han and Akshay Chandrashekaran and Jungsuk Kim and Ian Lane},
  journal= {arXiv preprint arXiv:1801.00059},
  year   = {2018}
}

备注

8 page, 3 figures, 8 tables; extra experimental results added