中文

基于邻域相似性的最小最大相关聚类

数据结构与算法 2025-02-19 v1 分布式、并行与集群计算

摘要

我们提出了一种用于解决最小最大相关聚类问题的高效算法。该问题的输入是一张标记为正(+)或负(-)的完全图,目标是找到一种聚类,以最小化所有顶点上不同步向量的\ell_{\infty}-范数。我们以一种高效的(3+ϵ)(3 + \epsilon)近似算法解决了这一问题,运行时间为准线性时间,O~(E+)\tilde{O}(|E^+|),其中E+|E^+|表示正边的数量。这改进了Heidrich、Irmai和Andres先前已知的最佳近似保证为4的算法,其算法运行时间为O(V2+VD2)O(|V|^2 + |V| D^2),其中V|V|是节点数,DD是图中最大度。此外,我们将算法扩展到大规模并行计算(MPC)模型和半流式模型。在MPC模型中,算法在内存为节点数的亚线性内存的机器上运行,耗时O(1)O(1)轮。在流式模型中,算法仅需要O~(V)\tilde{O}(|V|)空间,其中V|V|是图中顶点的数量。我们的算法纯粹是组合的。它们基于关于最优最小最大实例的一种新型结构观察,使我们能够使用O(E+)O(|E^+|)邻域相似性查询构建(3+ϵ)(3 + \epsilon)近似算法。通过利用随机投影,我们进一步显示这些查询可以在准线性时间内计算。

关键词

引用

@article{arxiv.2502.12519,
  title  = {Min-Max Correlation Clustering via Neighborhood Similarity},
  author = {Nairen Cao and Steven Roche and Hsin-Hao Su},
  journal= {arXiv preprint arXiv:2502.12519},
  year   = {2025}
}