中文

基于个性化PageRank的大规模块模型图定向采样

社会与信息网络 2020-07-02 v2 计算复杂性 数字图书馆 统计方法学 机器学习

摘要

本文为个性化PageRank(称为“PPR”)提供了统计理论与直观解释:这是一种从大规模网络中采样小型社区的主流技术。我们研究如下场景:完整网络难以全面获取或维护,但我们可以从感兴趣的种子节点出发,通过其连接“爬取”网络以发现其他节点。通过以设计方式爬取图,可在不查询整个大规模图的情况下近似PPR向量,使其成为雪球采样的替代方案。利用度修正随机块模型,我们研究PPR向量能否选出与种子节点同属一个块的节点。我们给出了PPR向量一种简单且可解释的形式,凸显其对目标块外高度数节点的偏向。我们考察了一种基于节点度数的简单调整,并建立了允许有向图的PPR聚类一致性结果。这些结果得益于近期展示特征向量逐元素收敛的技术进展。我们用大规模Twitter好友图说明该方法,通过使用Twitter应用程序编程接口进行爬取。我们发现调整与未调整的PPR技术是互补的方法,其中调整使结果特别局部化于种子节点周围,且偏向调整极大受益于度数正则化。

关键词

引用

@article{arxiv.1910.12937,
  title  = {Targeted sampling from massive block model graphs with personalized PageRank},
  author = {Fan Chen and Yini Zhang and Karl Rohe},
  journal= {arXiv preprint arXiv:1910.12937},
  year   = {2020}
}

备注

61 pages, 5 figures