中文

利用历史加速在线社交网络采样

社会与信息网络 2015-05-12 v3 物理与社会

摘要

如何对此类数据实现高效分析已成为一个日益重要的研究问题。鉴于此类社交网络的庞大规模,许多现有研究借助采样技术,通过其受限的 Web/API 接口从在线社交网络中抽取随机节点。它们几乎都使用完全相同的底层技术——随机游走(random walk),一种基于马尔可夫链蒙特卡洛(Markov Chain Monte Carlo)的方法,迭代地从当前节点转移到其随机邻居。随机游走天然契合该问题,因为对于大多数在线社交网络,我们能通过接口发出的唯一查询是获取给定节点的邻居(即无法访问完整图拓扑)。然而,随机游走存在一个“burn-in”期问题,需要大量转移/查询次数,采样分布才能收敛到平稳值,从而以统计有效的方式抽取样本。本文考虑一个新性问题:在不改变随机游走所达到的平稳分布的前提下,加速其基础设计(即减少所需查询次数)——从而为现有基于采样的在线社交网络分析技术提供一种更高效的“即插即用”替代方案。我们的核心思想是利用随机游走的历史来构造高阶马尔可夫链。我们提出了两种算法,循环邻居随机游走与分组邻居随机游走(Circulated Neighbors and Groupby Neighbors Random Walk, CNRW 和 GNRW),并证明无论社交网络拓扑如何,CNRW 和 GNRW 在达到相同平稳分布的同时比基线随机游走具有更高效率。我们通过真实社交网络与合成图上的大量实验证明了所提技术相对于现有方法的优越性。

关键词

引用

@article{arxiv.1505.00079,
  title  = {Leveraging History for Faster Sampling of Online Social Networks},
  author = {Zhuojie Zhou and Nan Zhang and Gautam Das},
  journal= {arXiv preprint arXiv:1505.00079},
  year   = {2015}
}

备注

Technical report for the VLDB 2015 paper