中文

基于二元词法依赖的新型统计解析器

cmp-lg 2008-02-03 v1 计算与语言

摘要

本文描述了一种基于解析树中中心词之间依存概率的新型统计解析器。标准的二元概率估计技术被扩展用于计算词对之间的依存概率。使用《华尔街日报》数据的测试表明,该方法的性能至少与SPATTER(Magerman 95, Jelinek et al 94)相当,后者在该任务的统计解析中已发表的最佳结果。该方法简洁性意味着模型可在15分钟内完成40,000个句子的训练。采用波束搜索策略后,解析速度可提升至每分钟超过200个句子,且精度损失可忽略不计。

关键词

引用

@article{arxiv.cmp-lg/9605012,
  title  = {A New Statistical Parser Based on Bigram Lexical Dependencies},
  author = {Michael Collins},
  journal= {arXiv preprint arXiv:cmp-lg/9605012},
  year   = {2008}
}

备注

8 pages, to appear in Proceedings of ACL 96. Uuencoded gz-compressed postscript file created by csh script uufiles