基于回退模型的介词短语附着
cmp-lg
2008-02-03 v1 计算与语言
摘要
近期研究考虑了语料库基础或统计方法来解决介词短语歧义问题。通常,形式为{v np1 p np2}的歧义动词短语通过考虑四个词头(v, n1, p和n2)的值的模型来解决。本文表明该问题类似于语音识别中的n-gram语言模型,并且最常用的方法之一——回退估计——是适用的。在Wall Street Journal数据上获得84.5%的准确率。一个令人惊讶的结果是低频事件的重要性——忽略在训练数据中出现次数少于5次的事件会将性能降低到81.6%。
引用
@article{arxiv.cmp-lg/9506020,
title = {GLR-Parsing of Word Lattices Using a Beam Search Method},
author = {Steffen Staab},
journal= {arXiv preprint arXiv:cmp-lg/9506020},
year = {2008}
}
备注
4 pages, 61K postscript, compressed, uuencoded, Eurospeech 9/95, Madrid