基于Hadoop MapReduce和Spark的卫星图像多重K-means++聚类
分布式、并行与集群计算
2016-05-09 v1
摘要
图像聚类是卫星图像挖掘的重要步骤之一。在我们的实验中,我们在同一轮MapReduce作业迭代中同时运行了具有不同初始质心和k值的多个K-means算法。对于初始质心的初始化,我们实现了可扩展的K-Means++ MapReduce (MR) 作业[1]。我们还在同一轮MR作业迭代中运行了用于多重聚类输出的简化轮廓指数[2]验证算法。本文探讨了上述聚类算法在MapReduce和Spark作业等大数据平台上的运行行为。选择Spark是因为其在涉及迭代的快速处理中广受欢迎。
引用
@article{arxiv.1605.01802,
title = {Multiple K Means++ Clustering of Satellite Image Using Hadoop MapReduce and Spark},
author = {Tapan Sharma and Dr. Vinod Shokeen and Dr. Sunil Mathur},
journal= {arXiv preprint arXiv:1605.01802},
year = {2016}
}
备注
9 Pages, Distributed Computing, Satellite Images, Clustering, Published in International Journal of Advanced Studies in Computer Science and Engineering, IJASCSE volume 5 issue 4, 2016