中文

图上的动态结构聚类

数据结构与算法 2021-08-27 v1

摘要

结构聚类(DynCluDynClu)是最流行的图聚类范式之一。本文考虑在动态图 G=V,EG = \langle V, E\rangle 上,在边插入和删除(更新)的情况下,采用两种常用相似度(即 Jaccard 相似度和余弦相似度)的 StrCluStrClu。目标是在更新时维护特定信息,以便在请求时可以在 O(V+E)O(|V| + |E|) 时间内检索 GG 上的 StrCluStrClu 聚类结果。现有技术的最坏情况成本为每次更新 O(V)O(|V|);我们利用 ρ\rho-近似概念显著改进了这一更新时间界限。具体而言,对于指定的失败概率 δ\delta^* 以及任意 MM 次更新的序列(无需提前知道 MM 的值),我们的算法 DynELMDynELM 在任意时刻以线性空间实现了每次更新 O(log2V+logVlogMδ)O(\log^2 |V| + \log |V| \cdot \log \frac{M}{\delta^*}) 的摊销成本。此外,在每次更新后的所有时刻,DynELMDynELM 以至少 1δ1 - \delta^* 的概率对聚类质量提供了可证明的“三明治”保证。我们进一步将 DynELMDynELM 扩展为最终算法 DynStrCluDynStrClu,该算法还支持 cluster-group-by 查询。给定 QVQ\subseteq V,该操作将 QQ 与每个 StrCluStrClu 簇的非空交集放入不同的组中。DynStrCluDynStrClu 不仅实现了 DynELMDynELM 的所有保证,而且能在 O(QlogV)O(|Q|\cdot \log |V|) 时间内运行 cluster-group-by 查询。我们通过在 15 个真实数据集上的大量实验展示了算法的性能。实验结果证实,我们的算法比现有技术的竞争者高效多达三个数量级,并且仍能提供高质量的结构聚类结果。此外,我们研究了两种相似度在近似聚类结果质量方面的差异。

关键词

引用

@article{arxiv.2108.11549,
  title  = {Dynamic Structural Clustering on Graphs},
  author = {Boyu Ruan and Junhao Gan and Hao Wu and Anthony Wirth},
  journal= {arXiv preprint arXiv:2108.11549},
  year   = {2021}
}