迈向无偏的BFS采样
社会与信息网络
2011-02-23 v1 网络与互联网体系结构
统计方法学
摘要
广度优先搜索(BFS)是用于采样大型未知互联网拓扑结构的广泛使用的方法。与随机游走和其他探索技术相比,其主要优势在于BFS样本本身就是一个合理的图,因此我们可以研究其拓扑特征。然而,经验观察表明,不完整的BFS偏向于高度数节点,这可能会严重影响测量结果。在本文中,我们首先分析量化了BFS采样的度数偏差。特别地,我们计算了在具有任意度数分布的随机图中,BFS预期观测到的节点度数分布作为已覆盖节点比例的函数。我们还表明,对于,所有常用的图遍历技术(BFS、DFS、Forest Fire、Snowball Sampling、RDS)都遭受完全相同的偏差。接下来,基于我们的理论分析,我们提出了一种实用的BFS偏差校正程序。它接收收集到的BFS样本及其比例作为输入。尽管未能捕捉到现实图中常见的许多图属性(如同配性),但我们的基于的校正技术在广泛的互联网拓扑结构以及Facebook和Orkut网络的两个大型BFS样本上表现良好。最后,我们考虑并评估了一系列替代校正程序,并证明,尽管它们对于任意拓扑结构是无偏的,但其较大的方差使它们远不如基于的技术有效。
引用
@article{arxiv.1102.4599,
title = {Towards Unbiased BFS Sampling},
author = {Maciej Kurant and Athina Markopoulou and Patrick Thiran},
journal= {arXiv preprint arXiv:1102.4599},
year = {2011}
}
备注
BFS, RDS, graph traversal, sampling bias correction