中文

神经语音识别器:面向大词汇量语音识别的声学到词LSTM模型

计算与语言 2016-11-01 v1 机器学习 神经与进化计算

摘要

我们展示的结果表明,有可能构建以整词作为声学单元的、具有竞争力且极大简化的大词汇量连续语音识别系统。我们使用带有CTC损失的深度双向LSTM RNN直接对约100,000词的输出词汇建模。该模型在125,000小时的半监督声学训练数据上训练,这使我们能够缓解词模型的数据稀疏问题。我们表明,CTC词模型作为端到端全神经语音识别模型表现非常好,无需使用需要发音词典的传统上下文相关子词音素单元,且没有任何语言模型,从而免去了解码的需要。我们证明CTC词模型优于带有子词单元的强大的、更复杂的、最先进的基线。

关键词

引用

@article{arxiv.1610.09975,
  title  = {Neural Speech Recognizer: Acoustic-to-Word LSTM Model for Large Vocabulary Speech Recognition},
  author = {Hagen Soltau and Hank Liao and Hasim Sak},
  journal= {arXiv preprint arXiv:1610.09975},
  year   = {2016}
}