中文

领导者、追随者与社区检测

机器学习 2019-09-24 v3 社会与信息网络 物理与社会

摘要

社交网络或图中的社区是连接紧密且相互重叠的顶点集。社区检测算法的有效性取决于寻找真实社区的准确性以及随数据规模扩展的能力。在这项工作中,我们做出了三项贡献。首先,我们证明了被称为 F1 分数的一种流行准确性度量(介于 0 和 1 之间,1 表示完美检测)的信息下界为 0.5。我们提供了一种平凡算法,能够为任何图生成 F1 分数为 0.5 的社区!有些令人惊讶的是,我们发现诸如模块度优化、BigClam 和 CESNA 等流行算法在流行的 IMDB 图上的 F1 分数低于 0.5。为了纠正这一问题,作为第二项贡献,我们提出了一种用于社区生成的生成模型——序列社区图,该模型受社交网络形成的启发。第三,受我们的生成模型启发,我们提出了领导者-追随者算法(LFA)。我们通过确立序列社区图为弦图这一结构性结论,证明了该算法能够恢复序列社区图的所有社区。对于大量流行的社交网络,它恢复社区的 F1 分数远高于其他流行算法。对于 IMDB 图,它获得了 0.81 的 F1 分数。我们还提出了对 LFA 的一种改进,称为快速领导者-追随者算法(FLFA),该算法除了具有高精度外,速度也很快,其扩展性在网络规模上几乎是线性的。

关键词

引用

@article{arxiv.1011.0774,
  title  = {Leaders, Followers, and Community Detection},
  author = {Dhruv Parthasarathy and Devavrat Shah and Tauhid Zaman},
  journal= {arXiv preprint arXiv:1011.0774},
  year   = {2019}
}

备注

11 pages, 6 figures