论聚类在个性化 PageRank 估计中的作用
社会与信息网络
2020-02-10 v3
摘要
个性化 PageRank (PPR) 是从另一个节点的视角衡量某节点重要性的指标(我们分别称这些节点为 和 )。PPR 已被用于许多应用中,例如为 Twitter 用户(源节点)提供关注推荐(被 PPR 认为重要的目标节点);此外,PPR 也已被用于诸如社区发现等图论问题中。然而,对于像 Twitter 这样的大型网络,计算 PPR 是不可行的,因此需要高效的估计算法。在本工作中,我们分析了 PPR 估计复杂度与聚类之间的关系。首先,我们设计了针对大量源/目标节点对的 PPR 估计算法。特别地,我们提出了现有单对估计器 的一个增强版本,该版本作为多对估计的基础组件更为实用。然后我们证明,可以利用共同的底层图高效地联合估计多对节点的 PPR,而不是使用基础算法分别处理每一对。接下来,我们表明联合估计方案的复杂度与当前源节点和目标节点之间的聚类程度密切相关,这表明当聚类发生时,多对 PPR 估计更为容易。最后,我们考虑在多台机器可用于并行计算时的 PPR 估计,设计了一种利用我们的聚类发现的方法,特别是利用 (原位)计算的量,以减少计算时间的方式将任务分配给机器。这证明了复杂度与聚类之间的关系在实际分布式环境中具有重要影响。
关键词
引用
@article{arxiv.1706.01091,
title = {On the role of clustering in Personalized PageRank estimation},
author = {Daniel Vial and Vijay Subramanian},
journal= {arXiv preprint arXiv:1706.01091},
year = {2020}
}
备注
Added theoretical results for stochastic block model (Theorem 5.2)