生成式超图聚类:从随机块模型到模块度
社会与信息网络
2021-08-20 v4 离散数学
数据分析、统计与概率
物理与社会
机器学习
摘要
超图是广泛复杂关系系统的自然建模范式。一个标准的分析任务是识别密切相关或密集互连的节点簇。许多用于该任务的图算法基于随机块模型(stochastic blockmodel)的变体,即一种具有灵活簇结构的随机图。然而,针对超图聚类的模型与算法很少。在此,我们提出一种泊松度修正超图随机块模型(DCHSBM),这是一种具有异构节点度和边大小的聚类超图生成模型。DCHSBM 中的近似最大似然推断自然导出一个聚类目标,该目标推广了图中流行的模块度目标。我们针对该目标推导了一个通用的 Louvain 型算法,以及一个更快的专用“全有或全无”(AON)变体,其中边预期完全位于簇内。这一特殊情况涵盖了一种近期提出的超图模块度方案,同时也引入了灵活的分辨率和边大小参数。我们展示了 AON 超图 Louvain 具有高度可扩展性,包括在一个百万节点合成超图上的实验示例。我们还通过合成实验表明,超图社区检测的可检测性机制不同于基于二部图投影的方法。我们使用我们的生成模型分析了学校接触网络、美国国会法案共同提案、美国国会委员会、共同购买行为中的产品类别以及网页浏览会话中的酒店位置中不同的高阶结构模式,发现了可解释的高阶结构。我们随后研究了 AON 超图 Louvain 算法的表现,发现它能够在展现出相应高阶结构的经验数据集中恢复真实簇。
引用
@article{arxiv.2101.09611,
title = {Generative hypergraph clustering: from blockmodels to modularity},
author = {Philip S. Chodrow and Nate Veldt and Austin R. Benson},
journal= {arXiv preprint arXiv:2101.09611},
year = {2021}
}
备注
23 pages + 7 pages of supplementary information, 3 tables, 4 figures