中文

基于回退模型的介词短语附着

cmp-lg 2008-02-03 v1 计算与语言

摘要

近期研究考虑了语料库基础或统计方法来解决介词短语歧义问题。通常,形式为{v np1 p np2}的歧义动词短语通过考虑四个词头(v, n1, p和n2)的值的模型来解决。本文表明该问题类似于语音识别中的n-gram语言模型,并且最常用的方法之一——回退估计——是适用的。在Wall Street Journal数据上获得84.5%的准确率。一个令人惊讶的结果是低频事件的重要性——忽略在训练数据中出现次数少于5次的事件会将性能降低到81.6%。

关键词

引用

@article{arxiv.cmp-lg/9506020,
  title  = {GLR-Parsing of Word Lattices Using a Beam Search Method},
  author = {Steffen Staab},
  journal= {arXiv preprint arXiv:cmp-lg/9506020},
  year   = {2008}
}

备注

4 pages, 61K postscript, compressed, uuencoded, Eurospeech 9/95, Madrid