中文

次子类取词概率能否帮助统计解析器?

cmp-lg 2007-05-23 v1 计算与语言

摘要

关于从语料库中自动获取词汇信息的研究正在产生大规模的计算词典,包含individual verbal predicates(单个谓词)的次子类取词备选方案相对频率的数据。然而,是否存在这种频率信息在实践中能显著提高统计解析器准确率的经验问题尚未得到回答。本文描述了一种实验,使用覆盖面广的统计语法和解析器进行英文解析,次子类取词频率来自十 million words(一千万词)的文本数据,结果表明这种信息确实能显著提高解析准确率。

关键词

引用

@article{arxiv.cmp-lg/9806013,
  title  = {Can Subcategorisation Probabilities Help a Statistical Parser?},
  author = {John Carroll and Guido Minnen and Ted Briscoe},
  journal= {arXiv preprint arXiv:cmp-lg/9806013},
  year   = {2007}
}

备注

9 pages, uses colacl.sty