中文

近似单源个性化PageRank查询的高效算法

社会与信息网络 2019-08-29 v1 数据库 数据结构与算法

摘要

给定图 GG、源节点 ss 和目标节点 tttt 相对于 ss 的个性化PageRank(PPR)是从 ss 出发的随机游走终止于 tt 的概率。PPR查询的一个重要变体是单源PPR(SSPPR),它枚举 GG 中的所有节点,并返回相对于给定源 ss 具有最高PPR值的 top-kk 个节点。PPR总体上以及SSPPR具体在网页搜索和社交网络中具有重要应用,例如在Twitter的Who-To-Follow推荐服务中。然而,已知PPR计算在大型图上代价高昂且难以索引。因此,以往的解决方案要么使用不保证结果质量的启发式方法,要么依赖现代数据中心强大的计算能力,代价高昂。受此启发,我们提出了用于近似PPR处理的有效无索引和基于索引的算法,并对结果质量提供了严格保证。我们首先提出FORA,这是一种近似SSPPR解决方案,以一种简单而非平凡的方式结合了两种现有方法:前向推(速度快但不保证质量)和蒙特卡洛随机游走(准确但速度慢),从而同时实现了高精度和高效率。此外,FORA包含一种简单有效的索引方案,以及一个具有高剪枝能力的top-kk选择模块。大量实验表明,所提出的解决方案比各自的竞争对手在效率上高出几个数量级。值得注意的是,在十亿边Twitter数据集上,FORA使用单台商用服务器在1秒内即可回答top-500近似SSPPR查询。

关键词

引用

@article{arxiv.1908.10583,
  title  = {Efficient Algorithms for Approximate Single-Source Personalized PageRank Queries},
  author = {Sibo Wang and Renchi Yang and Runhui Wang and Xiaokui Xiao and Zhewei Wei and Wenqing Lin and Yin Yang and Nan Tang},
  journal= {arXiv preprint arXiv:1908.10583},
  year   = {2019}
}

备注

Accepted in the ACM Transactions on Database Systems (TODS)