复合名词的概率模型
cmp-lg
2008-02-03 v1 计算与语言
摘要
诸如 example noun compound 之类的复合名词在自然语言中日益常见,对 NLP 系统构成诸多困难问题,尤其是增加解析复杂度。本文构建了一个用于对此类复合名词进行句法分析的概率模型。该模型基于名词之间的亲和关系知识来预测复合名词结构,这些知识可从语料库中获取。本文解决了该语料库方法固有的难题:通过使用语义驱动的词类来克服数据稀疏问题,并在模型中显式处理义项歧义。基于该模型的实现已在 Lauer (1994) 中描述,正确解析了 77% 的测试集。
引用
@article{arxiv.cmp-lg/9409003,
title = {A Probabilistic Model of Compound Nouns},
author = {Mark Lauer and Mark Dras},
journal= {arXiv preprint arXiv:cmp-lg/9409003},
year = {2008}
}
备注
9 pages, uuencoded compressed postscript, please ignore any undefined command error at end