从大规模文本中提取名词短语:混合方法及其自动评估
cmp-lg
2008-02-03 v1 计算与语言
摘要
从运行文本中获取名词短语对许多应用(如词语分组、术语索引等)十分有用。已有文献采用纯概率方法或纯规则型的名词短语语法来解决这一问题。在本文中,我们使用概率切分器来决定成分的隐式边界,并利用语言学知识通过有限状态机制提取名词短语。测试文本为 SUSANNE 语料库,结果通过与 SUSANNE 语料库的解析字段进行自动比较来评估。这一初步实验的结果令人鼓舞。
引用
@article{arxiv.cmp-lg/9405034,
title = {Extracting Noun Phrases from Large-Scale Texts: A Hybrid Approach and Its Automatic Evaluation},
author = {Kuang-hua Chen and Hsin-Hsi Chen},
journal= {arXiv preprint arXiv:cmp-lg/9405034},
year = {2008}
}
备注
8 pages, Postscript file, Unix compressed, uuencoded