比较 N-节点集重要性代表结果与节点重要性代表结果在类别聚类中的应用:一项探索性研究
数据库
2015-03-13 v1
摘要
数据量随空间增加而成比例增长,意味着对超大数据集进行聚类变得困难且耗时。采样是缩小数据集规模并提高聚类效率的重要技术之一。采样后,在类别域中将未标记对象分配到合适的聚类是不可能的。为解决这一问题,Chen 采用了一种称为最大代表数据标记 (MAximal Representative Data Labeling) 的方法,基于节点重要性代表 (Node Importance Representative) 和 N-节点重要性代表 (N-Node Importance Representative) 算法将每个未标记数据点分配到适当的聚类。本文在 Chen 研究的基础上,分析并比较了 NIR 和 NNIR 的结果,得出结论:在寻找未标记数据点与聚类之间的相似性时,这两种过程相互矛盾。我们提出了一种新的、更好的解决问题的方法,该方法能在所有聚类中寻找未标记数据点的相似性,同时为所需聚类中的数据分配提供最大相似性。
引用
@article{arxiv.1208.4809,
title = {Comparing N-Node Set Importance Representative results with Node Importance Representative results for Categorical Clustering: An exploratory study},
author = {H. Venkateswara Reddy and Dr. S. Viswanadha Raju and B. Ramasubba Reddy},
journal= {arXiv preprint arXiv:1208.4809},
year = {2015}
}
备注
16 pages, 4 figures, 3 equations