中文

迈向无偏的BFS采样

社会与信息网络 2011-02-23 v1 网络与互联网体系结构 统计方法学

摘要

广度优先搜索(BFS)是用于采样大型未知互联网拓扑结构的广泛使用的方法。与随机游走和其他探索技术相比,其主要优势在于BFS样本本身就是一个合理的图,因此我们可以研究其拓扑特征。然而,经验观察表明,不完整的BFS偏向于高度数节点,这可能会严重影响测量结果。在本文中,我们首先分析量化了BFS采样的度数偏差。特别地,我们计算了在具有任意度数分布pkp_k的随机图RG(pk)RG(p_k)中,BFS预期观测到的节点度数分布作为已覆盖节点比例ff的函数。我们还表明,对于RG(pk)RG(p_k),所有常用的图遍历技术(BFS、DFS、Forest Fire、Snowball Sampling、RDS)都遭受完全相同的偏差。接下来,基于我们的理论分析,我们提出了一种实用的BFS偏差校正程序。它接收收集到的BFS样本及其比例ff作为输入。尽管RG(pk)RG(p_k)未能捕捉到现实图中常见的许多图属性(如同配性),但我们的基于RG(pk)RG(p_k)的校正技术在广泛的互联网拓扑结构以及Facebook和Orkut网络的两个大型BFS样本上表现良好。最后,我们考虑并评估了一系列替代校正程序,并证明,尽管它们对于任意拓扑结构是无偏的,但其较大的方差使它们远不如基于RG(pk)RG(p_k)的技术有效。

关键词

引用

@article{arxiv.1102.4599,
  title  = {Towards Unbiased BFS Sampling},
  author = {Maciej Kurant and Athina Markopoulou and Patrick Thiran},
  journal= {arXiv preprint arXiv:1102.4599},
  year   = {2011}
}

备注

BFS, RDS, graph traversal, sampling bias correction