中文

关于数据导向解析的两个问题

cmp-lg 2008-02-03 v1 计算与语言

摘要

本文介绍了关于数据导向解析(DOP)模型的持续工作。在先前的研究中,DOP 在对康契尔树库(Penn Treebank)中经过清理的分析性词性标记字符串集合上进行测试,取得了优异的测试结果。然而,这仍然留下了两个重要问题未解:(1)DOP 在未经编辑数据上的表现如何?(2)DOP 如何用于解析包含未知词的词字符串?本文针对上述问题进行了探讨。我们展示了在未经编辑数据上的解析结果不如在清理后的数据上,但与其他模型相比仍然具有高度的竞争力。至于词字符串的解析,我们表明,问题的难度并不主要取决于未知词,而是取决于已知词中以前未出现的词性类别。我们提出了一种用于解析这些词的新方法,通过估计未知子树的概率来实现。该方法具有普遍的研究价值,因为它表明可以在不使用词性标注器的情况下获得良好的性能。据我们所知,我们的方法在康契尔树库词字符串上测试的其他统计解析器中性能最佳。

关键词

引用

@article{arxiv.cmp-lg/9606022,
  title  = {Two Questions about Data-Oriented Parsing},
  author = {Rens Bod},
  journal= {arXiv preprint arXiv:cmp-lg/9606022},
  year   = {2008}
}

备注

16 pages, Postscript; to appear in Proceedings Fourth Workshop on Very Large Corpora (WVLC-4)