BigFCM:Hadoop上快速、精确且可扩展的FCM
分布式、并行与集群计算
2018-11-26 v1
摘要
聚类在大数据挖掘中扮演着重要角色,既是建模技术,也是许多数据挖掘流程实现中的预处理步骤。模糊聚类通过允许每个数据记录以某种程度属于多个簇,提供了比非模糊方法更大的灵活性。然而,模糊聚类面临的一个严峻挑战是缺乏可扩展性。地球科学、生物学和网络等新兴领域的海量数据集确实需要高性能的并行与分布式计算来解决现实问题。尽管一些聚类方法已改进以在大数据平台上执行,但对于大型数据集其执行时间大幅增加。本文提出一种名为BigFCM的可扩展模糊C均值(FCM)聚类方法,并为Hadoop分布式数据平台设计。它基于MapReduce编程模型,利用包括高效缓存设计在内的若干机制,实现了执行时间数量级的降低。在数吉字节数据集上的广泛评估表明,BigFCM在保持聚类质量的同时具有可扩展性。
引用
@article{arxiv.1605.03047,
title = {BigFCM: Fast, Precise and Scalable FCM on Hadoop},
author = {Nasser Ghadiri and Meysam Ghaffari and Mohammad Amin Nikbakht},
journal= {arXiv preprint arXiv:1605.03047},
year = {2018}
}