一种基于禁忌搜索的聚类算法及其在Spark上的并行实现
分布式、并行与集群计算
2017-12-04 v3 社会与信息网络
摘要
著名的K-means聚类算法已广泛应用于从数据分析到物流应用的不同领域。然而,K-means算法可能受到诸如质心初始选择等因素的影响,并容易陷入局部最优。在本文中,我们提出了一种由禁忌搜索(Tabu Search)策略增强的改进K-means聚类算法,其更适应大数据应用的需求。我们的设计进一步被增强以利用基于Spark框架的并行处理。计算实验证明了我们的基于禁忌搜索的聚类算法相对于Spark MLlib中广泛使用的K-means方法版本在可扩展性、准确性和有效性方面的优越性。
引用
@article{arxiv.1702.01396,
title = {A Tabu Search based clustering algorithm and its parallel implementation on Spark},
author = {Yinhao Lu and Buyang Cao and Cesar Rego and Fred Glover},
journal= {arXiv preprint arXiv:1702.01396},
year = {2017}
}