削减不必要的长尾:云中高性价比大数据聚类
分布式、并行与集群计算
2019-09-24 v1 机器学习
摘要
大数据聚类常需要巨大的计算资源,而云计算无疑是有前景的解决方案之一。然而,若管理不当,云中的计算成本可能高得超出预期。长尾现象在大数据聚类领域被广泛观察到,这表明大部分时间常消耗在聚类过程的中后阶段。在本研究中,我们试图削减聚类过程中不必要的长尾,以最低可能的计算成本达到足够令人满意的精度。提出了一种新方法以实现云中高性价比的大数据聚类。通过用采样数据训练回归模型,我们可以使广泛使用的k-means与EM(期望最大化)算法在获得所需精度时自动提前停止。在四个流行数据集上进行了实验,结果表明借助我们所提方法,k-means与EM算法均能在云中实现高性价比。例如,在效率更高的k-means算法的案例研究中,我们发现达到99%精度仅需达到100%精度所需计算成本的47.71%-71.14%,而效率较低的EM算法需16.69%-32.04%的计算成本。换个角度说,在美国土地利用分类示例中,我们的方法每次使用可为政府节省多达$94,687.49。
引用
@article{arxiv.1909.10000,
title = {Cutting the Unnecessary Long Tail: Cost-Effective Big Data Clustering in the Cloud},
author = {Dongwei Li and Shuliang Wang and Nan Gao and Qiang He and Yun Yang},
journal= {arXiv preprint arXiv:1909.10000},
year = {2019}
}