中文

知识提取中有趣性度量的分类

信息论 2012-06-29 v1 math.IT

摘要

发现有趣的关联规则是数据挖掘中一个重要且活跃的研究领域。Apriori族算法基于两个规则提取度量:支持度和置信度。尽管这两个度量具有算法快速的优点,但它们会产生大量规则,其中大部分是冗余和不相关的。因此,有必要使用进一步的度量来过滤不有趣的规则。随后,许多综合研究从多个角度对有趣性度量进行了研究。已有不同的研究报告旨在识别规则提取度量的"良好"属性,并对61个度量进行了这些属性的评估。本文的目的有两个。首先,扩展要研究的度量和属性的数量,并对文献中提出的属性进行形式化。其次,根据这一形式化研究,对所研究的度量进行分类。本文进而识别出度量类别,以帮助用户在知识提取过程中通过选择一个或多个度量来有效地选择合适的度量。对61个度量的属性评估使我们能够识别出7类度量,我们使用两种不同的聚类技术获得了这些类别。

关键词

引用

@article{arxiv.1206.6741,
  title  = {Categorization of interestingness measures for knowledge extraction},
  author = {Sylvie Guillaume and Dhouha Grissa and Engelbert Mephu Nguifo},
  journal= {arXiv preprint arXiv:1206.6741},
  year   = {2012}
}

备注

34 pages, 4 figures