中文

利用RNN-Transducer探索流式端到端语音识别的架构、数据与建模单元

计算与语言 2018-01-04 v1 声音 音频与语音处理

摘要

我们研究使用循环神经网络转导器(RNN-T)训练端到端语音识别模型:这是一种流式的、全神经的序列到序列架构,可从转写声学数据中联合学习声学与语言模型组件。我们探索了多种模型架构,并展示了在额外文本或发音数据可用时模型可如何被进一步改进。该模型由一个从基于连接主义时序分类(CTC)的声学模型初始化的“编码器”和一个仅从文本数据训练得到的循环神经网络语言模型部分初始化的“解码器”组成。整个神经网络以RNN-T损失训练,并直接将识别出的转写文本作为字母串序列输出,从而实现端到端语音识别。我们发现通过使用捕获更长上下文并显著减少替换错误的子词单元(“wordpieces”),性能可进一步提升。最佳的RNN-T系统是一个十二层LSTM编码器与两层LSTM解码器、以30,000个wordpieces作为输出目标训练的系统,在语音搜索任务上实现了8.5%的词错误率,在语音听写任务上实现了5.2%的词错误率,并与语音搜索8.3%、语音听写5.4%的业界最优基线相当。

关键词

引用

@article{arxiv.1801.00841,
  title  = {Exploring Architectures, Data and Units For Streaming End-to-End Speech Recognition with RNN-Transducer},
  author = {Kanishka Rao and Haşim Sak and Rohit Prabhavalkar},
  journal= {arXiv preprint arXiv:1801.00841},
  year   = {2018}
}

备注

In Proceedings of IEEE ASRU 2017