中文

用于LVCSR的LSTM语言模型:首遍解码与格重打分

音频与语音处理 2019-07-03 v1 机器学习 声音 机器学习

摘要

基于LSTM的语言模型是现代LVCSR系统的重要组成部分,因为它们相比传统回退语言模型显著提升了性能。如何将其高效地融入解码过程一直是个公认的难题。本文提出一种结合一遍解码与格重打分的方法。我们在首遍解码中使用LSTM-LM,但对共享最后两个词的次优假设进行重组,随后对所得格进行重打分。我们在配备GPGPU的机器上运行系统,能够在Hub5'00和Librispeech评测语料上取得具有竞争力的结果,且运行速度快于实时。此外,我们简要探讨了在解码过程中对属于给定词假设的所有状态序列进行全求和而无需重组的可能性。

关键词

引用

@article{arxiv.1907.01030,
  title  = {LSTM Language Models for LVCSR in First-Pass Decoding and Lattice-Rescoring},
  author = {Eugen Beck and Wei Zhou and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:1907.01030},
  year   = {2019}
}