中文

随机树邻接语法中的前缀概率

计算与语言 2007-05-23 v1

摘要

语音识别的语言模型通常使用形如Pr(a_n | a_1, a_2, ..., a_{n-1})的概率模型。另一方面,随机语法通常用于为话语分配结构。通过计算前缀概率Sum_{w in Sigma*} Pr(a_1 ... a_n w)(其中w代表前缀a_1 ... a_n的所有可能终止),可以从这些语法构建上述形式的语言模型。本文的主要结果是给定随机树邻接语法(TAG)计算此类前缀概率的算法。该算法在O(n^6)时间内完成所需计算。预先计算那些不从前缀推导出任何单词但在结构上对其推导有贡献的子推导的概率,以实现终止。该算法使得现有的基于语料库的随机TAG估计技术能够用于语言建模。

关键词

引用

@article{arxiv.cs/9809026,
  title  = {Prefix Probabilities from Stochastic Tree Adjoining Grammars},
  author = {Mark-Jan Nederhof and Anoop Sarkar and Giorgio Satta},
  journal= {arXiv preprint arXiv:cs/9809026},
  year   = {2007}
}

备注

7 pages, 2 Postscript figures, uses colacl.sty, graphicx.sty, psfrag.sty