解析 DOP 模型的高效算法
cmp-lg
2008-02-03 v1 计算与语言
摘要
数据导向解析 (DOP) 在自然语言文本上的优异结果已得到报道 (Bod, 1993)。然而,现有算法计算密集且难以实现。先前的算法昂贵主要归因于两个因素:必须生成的指数级规则数量,以及使用蒙特卡洛解析算法。本文通过将 DOP 模型小且等价的概率上下文无关文法进行新型化简来解决第一个问题。通过一种新颖的确定性解析策略来解决第二个问题,该策略最大化正确构件的预期数量,而非正确解析树的概率。通过这些优化,实验结果显示出 97% 的跨越括号率和 88% 的零跨越括号率。这与 Bod 的结果有显著差异,与 Pereira 和 Schabes (1992) 对相同数据进行实验的结果相当。我们指出,Bod 的结果至少部分归因于极其不幸的测试数据选择,以及使用的数据比其他研究者的数据更干净。
引用
@article{arxiv.cmp-lg/9604008,
title = {Efficient Algorithms for Parsing the DOP Model},
author = {Joshua Goodman},
journal= {arXiv preprint arXiv:cmp-lg/9604008},
year = {2008}
}
备注
10 pages