中文

用于带符号网络聚类的正则化谱方法

机器学习 2020-11-04 v1 机器学习 统计理论 统计理论

摘要

我们研究带符号图中的 kk 路聚类问题。近年来,分析和建模带符号图(其中节点间的亲和度取正值或负值)受到了相当多的关注。最近,Cucuringu 等人 [CDGT 2019] 提出了一种谱方法,即 SPONGE(Signed Positive over Negative Generalized Eigenproblem,负广义特征问题上的正签名),其将聚类任务转化为优化适当定义的目标函数的广义特征值问题。该方法的动机来自社会平衡理论,其中聚类任务旨在将给定网络分解为互不相交的组,使得同一组内的个体由尽可能多的正边连接,而不同组的个体主要由负边连接。通过大量数值模拟,SPONGE 被证明达到了最先进的经验性能。在理论方面,[CDGT 2019] 在带符号随机块模型(SSBM)下,针对 k=2k=2 等大小簇、图适度稠密的 regime,分析了 SPONGE 和流行的 Signed Laplacian 方法。在这项工作中,我们在两方面基于 [CDGT 2019] 中 SPONGE 和 Signed Laplacian 归一化版本的结果展开。首先,对两种算法,我们将 [CDGT 2019] 的理论分析推广到适度稠密 regime 下 k2k \geq 2 不等大小簇的一般设定。其次,我们引入两种方法的正则化版本以处理稀疏图——标准谱方法表现不佳的 regime——并在相同 SSBM 模型下提供理论保证。据我们所知,正则化谱方法迄今尚未在带符号图聚类的设定中被考虑。我们用一组针对合成数据的广泛数值实验补充了我们的理论结果。

关键词

引用

@article{arxiv.2011.01737,
  title  = {Regularized spectral methods for clustering signed networks},
  author = {Mihai Cucuringu and Apoorv Vikram Singh and Déborah Sulem and Hemant Tyagi},
  journal= {arXiv preprint arXiv:2011.01737},
  year   = {2020}
}

备注

55 pages, 5 figures