中文

通过 SCORE 实现快速社区发现

统计方法学 2014-12-01 v2 社会与信息网络 物理与社会

摘要

考虑一个节点划分为 KK 个不同社区的网络。节点的社区标签未知,估计它们(即社区发现)是主要兴趣所在。度校正块模型(DCBM)是一种流行的网络模型。如何在 DCBM 下发现社区是一个有趣的问题,其主要挑战在于度异质性。我们提出了一种新的社区发现方法,称为特征向量比率谱聚类(SCORE)。与经典谱方法相比,主要创新在于利用第一主特征向量与其他各主特征向量之间的逐项比率进行聚类。设 AA 为网络的邻接矩阵。我们首先获得 AAKK 个主特征向量,记为 η^1,,η^K\hat{\eta}_1,\ldots,\hat{\eta}_K,并令 R^\hat{R}n×(K1)n\times (K-1) 矩阵,使得 R^(i,k)=η^k+1(i)/η^1(i)\hat{R}(i,k)=\hat{\eta}_{k+1}(i)/\hat{\eta}_1(i)1in1\leq i\leq n1kK11\leq k\leq K-1。然后我们使用 R^\hat{R} 并应用 kk-means 方法进行聚类。核心的惊喜在于,度异质性的影响很大程度上是辅助性的,可以通过取 η^k+1\hat{\eta}_{k+1}η^1\hat{\eta}_11kK11\leq k\leq K-1)之间的逐项比率有效地去除。该方法成功应用于网络博客数据和空手道俱乐部数据,错误率分别为 58/122258/12221/341/34。这些结果比经典谱方法的结果更令人满意。此外,与模块度方法相比,SCORE 更易于实现,计算速度更快,且错误率更低。我们建立了一个理论框架,表明在温和条件下,SCORE 能稳定地产生一致的社区发现。分析的核心是随机矩阵理论(RMT)的最新进展,其中矩阵形式的伯恩斯坦不等式尤为有用。

关键词

引用

@article{arxiv.1211.5803,
  title  = {Fast community detection by SCORE},
  author = {Jiashun Jin},
  journal= {arXiv preprint arXiv:1211.5803},
  year   = {2014}
}

备注

Published in at http://dx.doi.org/10.1214/14-AOS1265 the Annals of Statistics (http://www.imstat.org/aos/) by the Institute of Mathematical Statistics (http://www.imstat.org)