大型有向网络中高度实体的快速检测
社会与信息网络
2014-10-24 v2 数据结构与算法
物理与社会
摘要
本文解决了大型在线社交网络中高度实体的快速检测问题。该问题的实际重要性由大量持续收集和更新流行实体统计数据的公司所证实,这些公司通常使用实体的度数作为其流行度的近似。我们提出了一种简单、高效且易于实现的两阶段随机算法,为该问题提供了高度精确的解决方案。例如,我们的算法仅需一千次API请求即可在Twitter(一个拥有约十亿注册用户的网络)中找到前100名最受关注的用户,精确度超过90%。我们的算法显著优于现有方法,并服务于多种不同目的,例如在社交网络中找到最受欢迎的用户或最受欢迎的兴趣组。这项工作的一个重要贡献是使用极值理论(概率论的一个分支,研究随机样本中的极端事件和最大顺序统计量的性质)对提出的算法进行了分析。利用这一理论,我们推导出算法性能的准确预测,并表明用于找到前k个最受欢迎实体的API请求数量在实体数量上是次线性的。此外,我们正式表明,实体之间的高变异性(通过重尾分布表达)是算法效率的原因。我们以严格的数学方式量化了这一现象。
引用
@article{arxiv.1410.0571,
title = {Quick Detection of High-degree Entities in Large Directed Networks},
author = {Konstantin Avrachenkov and Nelly Litvak and Liudmila Ostroumova Prokhorenkova and Eugenia Suyargulova},
journal= {arXiv preprint arXiv:1410.0571},
year = {2014}
}