TeraHAC:面向万亿边图的层次凝聚聚类
数据结构与算法
2024-06-12 v2 数据库
分布式、并行与集群计算
信息检索
摘要
我们提出TeraHAC,一种(1+ε)-近似层次凝聚聚类(HAC)算法,可扩展至万亿边图。我们的算法基于一种计算(1+ε)-近似HAC的新方法,该方法新颖地结合了最近邻链算法与(1+ε)-近似HAC的概念。我们的方法允许将图划分到多台机器上,并在需要与其它分区通信前,于各分区内显著推进聚类计算。我们在多达8万亿条边的若干真实与合成图上评估TeraHAC。结果表明,与已知计算HAC的方法相比,TeraHAC所需轮数减少100倍以上;其速度可达SCC(最先进的分布式层次聚类算法)的8.3倍,同时质量高出1.16倍。事实上,TeraHAC基本保持了著名的HAC算法的质量,同时大幅改善了运行时间。
引用
@article{arxiv.2308.03578,
title = {TeraHAC: Hierarchical Agglomerative Clustering of Trillion-Edge Graphs},
author = {Laxman Dhulipala and Jason Lee and Jakub Łącki and Vahab Mirrokni},
journal= {arXiv preprint arXiv:2308.03578},
year = {2024}
}
备注
SIGMOD 2024