中文

快速增量式与个性化PageRank

数据结构与算法 2010-09-01 v2 数据库 信息检索

摘要

本文分析了蒙特卡洛方法在增量计算PageRank、个性化PageRank以及类似基于随机游走的方法(重点关注SALSA)时的效率,研究对象为大规模动态演化的社交网络。我们假设友谊图存储在分布式共享内存中,这与Twitter等大型社交网络的情况一致。对于全局PageRank,我们假设社交网络有nn个节点,并且mm条对抗性选择的边以随机顺序到达。我们证明,在重置概率为ϵ\epsilon的情况下,使用蒙特卡洛方法维护每个节点PageRank的精确估计所需的总工作量为O(nlnmϵ2)O(\frac{n\ln m}{\epsilon^{2}})。这显著优于所有已知的增量式PageRank界限。例如,如果我们在每条边到达时朴素地重新计算PageRank,简单的幂迭代方法需要Ω(m2ln(1/(1ϵ)))\Omega(\frac{m^2}{\ln(1/(1-\epsilon))})的总时间,而蒙特卡洛方法需要O(mn/ϵ)O(mn/\epsilon)的总时间;两者都代价高昂。此外,我们还证明可以同样高效地处理边的删除。接着,我们研究了从种子节点出发计算前kk个个性化PageRank的问题,假设个性化PageRank服从指数α<1\alpha < 1的幂律分布。我们证明,如果从每个节点出发存储R>qlnnR>q\ln n条随机游走(使用为全局PageRank概述的方法),其中qq为足够大的常数,那么对分布式社交网络数据库的期望调用次数为O(k/(R(1α)/α))O(k/(R^{(1-\alpha)/\alpha}))。我们还展示了来自社交网站Twitter的实验结果,验证了我们的假设和分析。总体结果是,该算法足够快,能够支持动态社交网络上的实时查询。

关键词

引用

@article{arxiv.1006.2880,
  title  = {Fast Incremental and Personalized PageRank},
  author = {Bahman Bahmani and Abdur Chowdhury and Ashish Goel},
  journal= {arXiv preprint arXiv:1006.2880},
  year   = {2010}
}