中文

多对数深度的层次凝聚图聚类

数据结构与算法 2022-06-24 v1 分布式、并行与集群计算

摘要

由于现实世界数据集规模巨大,获得可扩展的层次凝聚聚类(Hierarchical Agglomerative Clustering, HAC)算法具有重要意义。同时,由于该算法看似顺序的本质,高效并行化 HAC 十分困难。本文解决此问题,提出 ParHAC,这是首个针对广泛使用的平均连接函数具有亚线性深度的高效并行 HAC 算法。特别地,我们给出了在 mm 边图上该问题的 (1+ϵ)(1+\epsilon)-近似算法,使用 O~(m)\tilde{O}(m) 工作量和多对数深度。此外,我们证明在标准复杂性理论假设下,为精确平均连接 HAC 获得类似界是不可能的。我们以关于 ParHAC 算法可扩展性、性能和质量的研究补充了理论结果,并与多个最先进的顺序和并行基线比较。在一组广泛的大型公开真实数据集上,我们发现 ParHAC 相较最佳顺序基线平均获得 50.1 倍加速,同时达到与精确 HAC 算法相似的质量。我们还展示 ParHAC 可使用商用多核机器在略超三小时内聚类最大的公开图数据集之一(1240 亿条边)。

关键词

引用

@article{arxiv.2206.11654,
  title  = {Hierarchical Agglomerative Graph Clustering in Poly-Logarithmic Depth},
  author = {Laxman Dhulipala and David Eisenstat and Jakub Łącki and Vahab Mirronki and Jessica Shi},
  journal= {arXiv preprint arXiv:2206.11654},
  year   = {2022}
}