中文

基于Hadoop MapReduce和Spark的卫星图像多重K-means++聚类

分布式、并行与集群计算 2016-05-09 v1

摘要

图像聚类是卫星图像挖掘的重要步骤之一。在我们的实验中,我们在同一轮MapReduce作业迭代中同时运行了具有不同初始质心和k值的多个K-means算法。对于初始质心的初始化,我们实现了可扩展的K-Means++ MapReduce (MR) 作业[1]。我们还在同一轮MR作业迭代中运行了用于多重聚类输出的简化轮廓指数[2]验证算法。本文探讨了上述聚类算法在MapReduce和Spark作业等大数据平台上的运行行为。选择Spark是因为其在涉及迭代的快速处理中广受欢迎。

关键词

引用

@article{arxiv.1605.01802,
  title  = {Multiple K Means++ Clustering of Satellite Image Using Hadoop MapReduce and Spark},
  author = {Tapan Sharma and Dr. Vinod Shokeen and Dr. Sunil Mathur},
  journal= {arXiv preprint arXiv:1605.01802},
  year   = {2016}
}

备注

9 Pages, Distributed Computing, Satellite Images, Clustering, Published in International Journal of Advanced Studies in Computer Science and Engineering, IJASCSE volume 5 issue 4, 2016