压缩宾州树库语法
计算与语言
2007-05-23 v1
摘要
树库,如宾州树库(PTB),提供了一种获取广泛覆盖语法的简单方法:可以直接从树库中的解析树读取语法。虽然这样的语法易于获得,但规则集随语料库大小以平方根速率增长表明,推导出的语法远非完整,需要更多的树库文本才能获得完整语法(如果存在某种极限的话)。然而,我们提出了另一种解释,即树库内结构的不充分指定。我们通过应用一种算法来压缩推导出的语法,消除冗余规则——即其右侧可由其他规则解析的规则——来探索这一假设。所得压缩语法的大小显著小于完整树库语法,并显示出趋近于一个极限。然而,这样的压缩语法并未产生非常好的性能指标。我们提出了一种考虑规则概率的压缩算法版本,并认为其更具语言学动机。结合简单的阈值处理,该方法可使语法大小减少58%而解析性能无明显变化,并可实现69%的缩减,同时召回率有所提高,但精确率有所下降。
引用
@article{arxiv.cs/9902001,
title = {Compacting the Penn Treebank Grammar},
author = {Alexander Krotov and Mark Hepple and Robert Gaizauskas and Yorick Wilks},
journal= {arXiv preprint arXiv:cs/9902001},
year = {2007}
}
备注
5 pages, 2 figures