基于检验的网络显著社区识别提取算法
社会与信息网络
2014-12-04 v4 物理与社会
统计方法学
摘要
网络研究中一个常见且重要的问题是如何将给定网络的顶点划分为一个或多个称为社区的组,使得同一社区内的顶点比属于不同社区的顶点连接更紧密。我们提出并研究了一种基于检验的社区发现过程,称为统计显著社区提取 (ESSC)。ESSC 过程基于值来衡量单个顶点与一组顶点之间的连接强度,其参考分布源自条件配置网络模型。该过程自动选择网络中的社区数量及其大小。此外,ESSC 能够处理重叠社区,并且与大多数现有方法不同,它能识别不属于明确定义社区的"背景"顶点。该方法仅有一个参数,用于控制假设检验的严格性。我们通过使用四个真实网络数据集的验证研究,调查了 ESSC 的性能和潜在用途,并将其与多种现有方法进行了比较。此外,我们进行了模拟研究,以评估 ESSC 在具有各类社区结构的网络中的有效性,包括具有重叠社区的网络和具有背景顶点的网络。这些结果表明,ESSC 是发现复杂网络系统中相关社区结构的有效探索工具。数据和软件可在\urlhttp://www.unc.edu/~jameswd/research.html 获取。
引用
@article{arxiv.1308.0777,
title = {A testing based extraction algorithm for identifying significant communities in networks},
author = {James D. Wilson and Simi Wang and Peter J. Mucha and Shankar Bhamidi and Andrew B. Nobel},
journal= {arXiv preprint arXiv:1308.0777},
year = {2014}
}
备注
Published in at http://dx.doi.org/10.1214/14-AOAS760 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)