统计语言模型的分析与改进——面向语音识别
cmp-lg
2008-02-03 v1 计算与语言
摘要
在许多当前的语音识别器中,都会使用统计语言模型来指示在已识别出的词语之后,某一词语被 spoken next 的可能性有多大。如何改进统计语言模型以便解决更复杂的语音识别任务?由于了解任何理论的弱点往往有助于改进该理论,本论文的核心思想是分析现有统计语言模型的弱点,以便随后对其进行改进。为此,我们以总概率的对数形式(LTP)正式定义了统计语言模型的一种弱点,这一概念与评估统计语言模型的标准困惑度(perplexity)度量方式密切相关。我们将对弱点的定义应用于一种常用的统计语言模型,即bi-pos模型。这一结果例如产生了一种新的未知词建模方式,可使模型性能提升14%至21%。此外,识别出的某种弱点促成了我们提出的广义N-pos语言模型的开发,这一模型也在本论文中阐述。它能够将语言知识纳入,即便这种知识跨越多个词语,而这在传统N-pos模型中是不可实现的。这引出了关于应将何种知识添加到一般统计语言模型中的讨论,我们给出了挑选 potentially 有用知识的准则。这些结果表明,我们对弱点定义以及对统计语言模型一般性弱点的进行分析的实用性。
引用
@article{arxiv.cmp-lg/9406027,
title = {Analyzing and Improving Statistical Language Models for Speech Recognition},
author = {Joerg P. Ueberla},
journal= {arXiv preprint arXiv:cmp-lg/9406027},
year = {2008}
}
备注
140 pages, postscript, approx 500KB, if problems with delivery, mail to [email protected]