重采样对网络聚类和排序显著性分析的影响
物理与社会
2013-02-12 v2 社会与信息网络
摘要
社区检测有助于简化网络的复杂结构,但只有当社区具有统计显著性时才是可靠的。为了检测具有统计显著性的社区,一种常见的方法是对原始网络进行重采样并分析其社区。然而,重采样假设样本之间相互独立,而网络的组成部分本质上是相互依赖的。因此,我们必须理解打破重采样分量之间的依赖关系如何影响显著性分析的结果。在此,我们使用科学交流作为模型系统来分析这种效应。我们的数据集包含 1984-2010 年间发表在期刊上的文章之间的引用关系。我们将引用的参数重采样与文章的非参数重采样进行了比较。虽然引用重采样打破了链接依赖关系,但文章重采样保留了这种依赖关系。我们发现引用重采样低估了链接权重的方差。此外,这种低估解释了排序和聚类显著性分析中大部分差异。因此,当仅有链接权重可用且无法进行文章重采样时,我们建议采用一种简单的参数重采样方案,该方案生成的链接权重方差接近文章重采样的链接权重方差。尽管如此,当我们强调和总结科学中的重要结构变化时,我们在重采样方案中能保留的依赖关系越多,就能越早预测结构变化。
引用
@article{arxiv.1208.6157,
title = {Resampling effects on significance analysis of network clustering and ranking},
author = {Atieh Mirshahvalad and Olivier H. Beauchesne and Eric Archambault and Martin Rosvall},
journal= {arXiv preprint arXiv:1208.6157},
year = {2013}
}
备注
12 pages, 7 figures