词汇共现、统计显著性与词语关联
计算与语言
2010-09-01 v1 信息检索
摘要
词汇共现是检测词语关联的重要线索。我们提出了一个理论框架,用于从给定语料库中发现统计上显著的词汇共现。与普遍重视单字词频的做法相反,我们只关注同时包含(候选二元组的)两个术语的文档。我们检测关联词跨度分布中的偏差,同时忽略全局单字词频的变化。我们的框架能够根据数据中共现的文档级和语料级线索的强度,区分不同类别的词汇共现。我们在基准数据集上进行了大量实验,以研究文献中已知的各种共现度量的性能。我们发现,一个相对冷门的度量Ochiai和新引入的度量CSA最能捕捉词汇共现的概念,其次是LLR、Dice和TTest,而另一个流行度量PMI在词汇共现的背景下表现令人惊讶地差。
引用
@article{arxiv.1008.5287,
title = {Lexical Co-occurrence, Statistical Significance, and Word Association},
author = {Dipak Chaudhari and Om P. Damani and Srivatsan Laxman},
journal= {arXiv preprint arXiv:1008.5287},
year = {2010}
}