中文

用于解析的统计决策树模型

cmp-lg 2008-02-03 v1 计算与语言

摘要

句法自然语言解析器已被证明不足以处理高度歧义的大词汇量文本,这从它们在华尔街日报等领域的表现不佳以及整体上远离基于解析的文本处理方法可以得到证明。在本文中,我描述了 SPATTER,一个基于决策树学习技术的统计解析器,它为每个句子构建完整的解析,并且准确率达到远超任何已发布结果的水平。这项工作基于以下前提:(1) 语法对于大多数有趣领域来说过于复杂和详细,无法手动开发;(2) 解析模型必须严重依赖词汇和上下文信息来准确分析句子;(3) 现有的 n-gram 建模技术对于解析模型来说是不充分的。在将 SPATTER 与 IBM 的计算机手册解析器进行比较的实验中,SPATTER 显著优于基于语法的解析器。使用 PARSEVAL 指标在 Penn Treebank 华尔街日报语料库上评估 SPATTER,对于 40 个词或更少的句子,SPATTER 达到 86% 精确率、86% 召回率以及每句 1.3 个交叉括号;对于长度在 10 到 20 个词之间的句子,达到 91% 精确率、90% 召回率以及 0.5 个交叉括号。

关键词

引用

@article{arxiv.cmp-lg/9504030,
  title  = {Statistical Decision-Tree Models for Parsing},
  author = {David M. Magerman},
  journal= {arXiv preprint arXiv:cmp-lg/9504030},
  year   = {2008}
}

备注

uses aclap.sty, psfig.tex (v1.9), postscript figures