中文

图上分布内容的采样

社会与信息网络 2013-11-18 v1 物理与社会

摘要

尽管近期 efforts 致力于估计大型图(即在线社交网络和对等网络)的拓扑特征,但很少有人关注开发一种形式化方法来表征分布在这些网络上的海量内容。由于这些网络的大规模特性,对此类内容进行穷举枚举在计算上是不可行的。在本文中,我们展示了如何仅通过对一小部分顶点进行采样来获取内容属性。我们首先表明,当朴素地应用采样时,这会在内容统计中产生巨大偏差(即内容重复的平均数量)。为了消除这种偏差,可以使用最大似然估计来估计内容特征。然而,我们的实验结果表明,使用此类方法获得准确统计需要采样图中的大多数顶点。为应对这一挑战,我们提出了两种高效估计量:特殊副本估计量 (SCE) 和加权副本估计量 (WCE),以利用采样内容中的可用信息来测量内容特征。SCE 使用特殊内容副本指示器来计算估计值,而 WCE 则基于采样顶点中的元信息推导估计值。我们进行了实验,表明 WCE 和 SCE 具有成本效益且是“渐近无偏的”。我们的方法论为研究人员提供了一种新工具,以高效查询分布在大规模网络中的内容。

关键词

引用

@article{arxiv.1311.3882,
  title  = {Sampling Content Distributed Over Graphs},
  author = {Pinghui Wang and Junzhou Zhao and John C. S. Lui and Don Towsley and Xiaohong Guan},
  journal= {arXiv preprint arXiv:1311.3882},
  year   = {2013}
}