中文

自然语言解析作为统计模式识别

cmp-lg 2016-08-31 v2 计算与语言

摘要

传统的自然语言解析器基于语法学家以艰苦、耗时的方式开发的重写规则系统。语法学家的大部分精力都投入到消歧过程中,首先假设规则来规定歧义句子中成分类别和词间关系,然后寻找这些规则的例外和修正。在这项工作中,我提出了一种从一组已解析句子中自动获取统计解析器的方法,该方法利用了一些初始语言输入,但避免了迭代且看似无尽的语法开发过程的陷阱。基于语言分布特征和语言特征,该解析器获取一组统计决策树,根据输入句子在解析树空间上分配概率分布。这些决策树利用大量的语境信息,可能包括句子中的所有词汇信息,来生成高精度的消歧统计模型。通过基于熵缩减而非人类直觉来选择消歧标准,该解析器开发方法能够考虑比语法学家在制定单个消歧规则时更多的句子。在使用此统计框架获取的解析器与语法学家经过十年开发的基于规则的解析器之间的实验中,两者使用相同的训练材料和测试句子,基于决策树的解析器在语法学家试图最大化的准确率指标上显著优于基于规则的解析器,达到了 78% 的准确率,而基于规则的解析器为 69%。

关键词

引用

@article{arxiv.cmp-lg/9405009,
  title  = {Natural Language Parsing as Statistical Pattern Recognition},
  author = {David M. Magerman},
  journal= {arXiv preprint arXiv:cmp-lg/9405009},
  year   = {2016}
}

备注

160+ pages, doctoral dissertation (latex with figures)