中文

用于层次文档聚类的基于最大频繁项集的隐私保护相似性度量

数据库 2012-07-13 v1 信息检索

摘要

万维网规模的不断增长给研究人员提高互联网搜索效率带来了巨大挑战。如今,Web 文档聚类已成为一个重要的研究课题,旨在针对简单查询返回的海量结果提供最相关的文档。在本文中,我们首先提出了一种新方法,通过 Apriori 算法基于最大频繁项集(MFI)精确定义聚类。随后,将同样的基于最大频繁项集(MFI)的相似性度量用于层次文档聚类。通过考虑最大频繁项集,降低了文档集的维度。其次,提供开放 Web 文档的隐私保护是为了避免重复文档。从而我们可以保护文档的个人版权隐私。这可以使用等价关系来实现。

关键词

引用

@article{arxiv.1207.2900,
  title  = {Privacy Preserving MFI Based Similarity Measure For Hierarchical Document Clustering},
  author = {P. Rajesh and G. Narasimha and N. Saisumanth},
  journal= {arXiv preprint arXiv:1207.2900},
  year   = {2012}
}

备注

6 pages,1 table,1 figure