中文

一种基于禁忌搜索的聚类算法及其在Spark上的并行实现

分布式、并行与集群计算 2017-12-04 v3 社会与信息网络

摘要

著名的K-means聚类算法已广泛应用于从数据分析到物流应用的不同领域。然而,K-means算法可能受到诸如质心初始选择等因素的影响,并容易陷入局部最优。在本文中,我们提出了一种由禁忌搜索(Tabu Search)策略增强的改进K-means聚类算法,其更适应大数据应用的需求。我们的设计进一步被增强以利用基于Spark框架的并行处理。计算实验证明了我们的基于禁忌搜索的聚类算法相对于Spark MLlib中广泛使用的K-means方法版本在可扩展性、准确性和有效性方面的优越性。

关键词

引用

@article{arxiv.1702.01396,
  title  = {A Tabu Search based clustering algorithm and its parallel implementation on Spark},
  author = {Yinhao Lu and Buyang Cao and Cesar Rego and Fred Glover},
  journal= {arXiv preprint arXiv:1702.01396},
  year   = {2017}
}