基于邻域相似性的最小最大相关聚类
数据结构与算法
2025-02-19 v1 分布式、并行与集群计算
摘要
我们提出了一种用于解决最小最大相关聚类问题的高效算法。该问题的输入是一张标记为正(+)或负(-)的完全图,目标是找到一种聚类,以最小化所有顶点上不同步向量的-范数。我们以一种高效的近似算法解决了这一问题,运行时间为准线性时间,,其中表示正边的数量。这改进了Heidrich、Irmai和Andres先前已知的最佳近似保证为4的算法,其算法运行时间为,其中是节点数,是图中最大度。此外,我们将算法扩展到大规模并行计算(MPC)模型和半流式模型。在MPC模型中,算法在内存为节点数的亚线性内存的机器上运行,耗时轮。在流式模型中,算法仅需要空间,其中是图中顶点的数量。我们的算法纯粹是组合的。它们基于关于最优最小最大实例的一种新型结构观察,使我们能够使用邻域相似性查询构建近似算法。通过利用随机投影,我们进一步显示这些查询可以在准线性时间内计算。
引用
@article{arxiv.2502.12519,
title = {Min-Max Correlation Clustering via Neighborhood Similarity},
author = {Nairen Cao and Steven Roche and Hsin-Hao Su},
journal= {arXiv preprint arXiv:2502.12519},
year = {2025}
}