中文

Stop-and-Stare:十亿规模网络中病毒式营销的最优采样算法

社会与信息网络 2017-02-23 v3 数据结构与算法 物理与社会

摘要

影响力最大化(IM)旨在寻找一小部分关键用户,将影响力广泛传播到网络中,是多个领域中的核心问题。它在病毒式营销、流行病控制和评估复杂系统中的级联故障方面有应用。尽管付出了巨大努力,在如Facebook、Twitter和万维网等十亿规模网络中的IM仍未得到满意解决。即使是最先进的方法如TIM+和IMM在这些网络上也可能需要数天。在本文中,我们提出SSA和D-SSA,两种用于基于IM的病毒式营销问题的新颖采样框架。SSA和D-SSA比SIGMOD'15最佳方法IMM快达1200倍,同时提供相同的(11/eϵ)(1-1/e-\epsilon)近似保证。我们框架的基础是一种创新的Stop-and-Stare策略,其中它们在指数检查点停止以验证(注视)是否有关于解质量的充分统计证据。理论上,我们证明SSA和D-SSA是首批使用(渐近)最小样本数并满足IM的严格理论阈值的近似算法。SSA和D-SSA的绝对优越性通过对IM和另一个名为TVM的主题感知病毒式营销问题的真实网络数据的大量实验得到证实。源代码可在 https://github.com/hungnt55/Stop-and-Stare 获取。

关键词

引用

@article{arxiv.1605.07990,
  title  = {Stop-and-Stare: Optimal Sampling Algorithms for Viral Marketing in Billion-scale Networks},
  author = {Hung T. Nguyen and My T. Thai and Thang N. Dinh},
  journal= {arXiv preprint arXiv:1605.07990},
  year   = {2017}
}

备注

Correct the errors in the proofs for SSA/D-SSA. Update D-SSA to estimate \epsilon(s) instead of \delta(s)