中文

面向历史驱动语法:用于概率解析的更丰富模型

cmp-lg 2008-02-03 v1 计算与语言

摘要

本文描述了一个我们称为 HBG 的自然语言生成概率模型,该模型利用详细的语言信息来解决歧义问题。HBG 以一种新颖的方式将词汇、句法、语义和结构信息从解析树整合到消歧过程中。我们使用一个称为 Treebank 的括号标注句子语料库,结合决策树构建来提取解析树中决定句子正确解析的相关方面。这与通常通过语言内省进一步调整语法以期生成正确解析的方法形成对比。在与一个我们称为 P-CFG 的最佳现有鲁棒概率解析模型的头对头测试中,HBG 模型显著优于 P-CFG,将解析准确率从 60% 提高到 75%,错误率降低了 37%。

关键词

引用

@article{arxiv.cmp-lg/9405007,
  title  = {Towards History-based Grammars: Using Richer Models for Probabilistic Parsing},
  author = {Ezra Black and Fred Jelinek and John Lafferty and David M. Magerman and Robert Mercer and Salim Roukos},
  journal= {arXiv preprint arXiv:cmp-lg/9405007},
  year   = {2008}
}

备注

6 pages