用于文档索引的名词短语快速统计解析
cmp-lg
2008-02-03 v1 计算与语言
摘要
信息检索(IR)是自然语言处理(NLP)的重要应用领域,其中面临处理大量非受限自然语言文本的真正挑战。虽然已付出大量努力将 NLP 技术应用于 IR,但很少有 NLP 技术在超过数兆字节的文档集合上进行过评估。许多 NLP 技术在效率和稳健性上不足以处理大量文本。本文提出了一种新的名词短语解析概率模型,并报告了将此类解析技术应用于增强文档索引的情况。通过解析器提供的句法短语补充单词进行索引的有效性,在一个 250 兆字节的文档集合上进行了评估。实验结果表明,通过句法短语补充单词进行索引能够持续且显著地提升检索性能。
引用
@article{arxiv.cmp-lg/9702009,
title = {Fast Statistical Parsing of Noun Phrases for Document Indexing},
author = {Chengxiang Zhai},
journal= {arXiv preprint arXiv:cmp-lg/9702009},
year = {2008}
}
备注
8 pages, LaTex; uses aclap.sty. To appear in Proceedings of the 5th Conference on Applied Natural Language Processing, Washington DC, 31 March - 3 April, 1997.