大图上的并行相关聚类
分布式、并行与集群计算
2015-07-21 v2 数据结构与算法
机器学习
摘要
给定项目间的相似性图,相关聚类(CC)将相似项目归为一组,不相似项目分开。最流行的CC算法之一是KwikCluster:一种串行聚类顶点邻域的算法,可获得3-近似比。不幸的是,KwikCluster在实践中需要大量聚类轮次,这对大图而言是潜在瓶颈。我们提出C4和ClusterWild!两种并行相关聚类算法,它们可在对数多项式轮次内运行,并实现可证明的近线性加速。C4使用并发控制来强制并行聚类过程的可串行化,并保证3-近似比。ClusterWild!是一种无协调算法,为获得更好的可扩展性而放弃一致性;这导致3-近似比的可证明微小损失。我们为两种算法提供了广泛的实验结果,在聚类精度和运行时间方面均优于现有最优方法。我们展示,我们的算法能在32核上于5秒内聚类十亿边图,同时实现15倍加速。
引用
@article{arxiv.1507.05086,
title = {Parallel Correlation Clustering on Big Graphs},
author = {Xinghao Pan and Dimitris Papailiopoulos and Samet Oymak and Benjamin Recht and Kannan Ramchandran and Michael I. Jordan},
journal= {arXiv preprint arXiv:1507.05086},
year = {2015}
}