中文

计算前缀概率的高效概率上下文无关语法解析算法

cmp-lg 2008-02-03 v1 计算与语言

摘要

我们描述了 Earley 解析器的一个扩展,用于随机上下文无关语法 (SCFG)。给定随机上下文无关语法和输入字符串,该算法计算以下数量:a) 各成功前缀由语法生成的概率;b) 由非终端符号生成的子串概率,包括整个字符串由语法生成的概率;c) 字符串的最可能 (Viterbi) 解析;d) 每条语法规则被应用的后验期望次数,用于重新估计规则概率。(a) 和 (b) 采用单次从左到右遍历输入的方式逐步计算。该算法相较于标准的 SCFG 自底向上解析方法具有优势,主要在于利用 Earley 的自顶向下控制结构,使其对稀疏语法高效;且可处理任意上下文无关规则格式,无需转换为某种正规形式;同时将 (a) 至 (d) 的计算合并于单一算法中。最后,算法还具有处理半括号输入、在非语法输入上查找部分解析及其概率的简单扩展。

关键词

引用

@article{arxiv.cmp-lg/9411029,
  title  = {An Efficient Probabilistic Context-Free Parsing Algorithm that Computes Prefix Probabilities},
  author = {Andreas Stolcke},
  journal= {arXiv preprint arXiv:cmp-lg/9411029},
  year   = {2008}
}

备注

45 pages. Slightly shortened version to appear in Computational Linguistics 21