近似单源个性化PageRank查询的高效算法
社会与信息网络
2019-08-29 v1 数据库
数据结构与算法
摘要
给定图 、源节点 和目标节点 , 相对于 的个性化PageRank(PPR)是从 出发的随机游走终止于 的概率。PPR查询的一个重要变体是单源PPR(SSPPR),它枚举 中的所有节点,并返回相对于给定源 具有最高PPR值的 top- 个节点。PPR总体上以及SSPPR具体在网页搜索和社交网络中具有重要应用,例如在Twitter的Who-To-Follow推荐服务中。然而,已知PPR计算在大型图上代价高昂且难以索引。因此,以往的解决方案要么使用不保证结果质量的启发式方法,要么依赖现代数据中心强大的计算能力,代价高昂。受此启发,我们提出了用于近似PPR处理的有效无索引和基于索引的算法,并对结果质量提供了严格保证。我们首先提出FORA,这是一种近似SSPPR解决方案,以一种简单而非平凡的方式结合了两种现有方法:前向推(速度快但不保证质量)和蒙特卡洛随机游走(准确但速度慢),从而同时实现了高精度和高效率。此外,FORA包含一种简单有效的索引方案,以及一个具有高剪枝能力的top-选择模块。大量实验表明,所提出的解决方案比各自的竞争对手在效率上高出几个数量级。值得注意的是,在十亿边Twitter数据集上,FORA使用单台商用服务器在1秒内即可回答top-500近似SSPPR查询。
关键词
引用
@article{arxiv.1908.10583,
title = {Efficient Algorithms for Approximate Single-Source Personalized PageRank Queries},
author = {Sibo Wang and Renchi Yang and Runhui Wang and Xiaokui Xiao and Zhewei Wei and Wenqing Lin and Yin Yang and Nan Tang},
journal= {arXiv preprint arXiv:1908.10583},
year = {2019}
}
备注
Accepted in the ACM Transactions on Database Systems (TODS)