中文

大规模网络聚类算法与聚类质量度量的分析

社会与信息网络 2016-08-04 v4 物理与社会

摘要

社区质量的概念是网络聚类的基础。尽管围绕网络聚类的研究日益普遍,但对不同聚类质量度量之间关系的精确理解尚属未知。本文通过对四种广泛使用的网络聚类算法——Louvain、Infomap、标签传播(label propagation)和智能局部移动(smart local moving)——的严谨分析,考察了独立聚类质量度量与信息恢复度量之间的关系。我们考虑了模块度(modularity)、传导率(conductance)和覆盖率(coverage)等独立质量度量,以及调整兰德指数(adjusted Rand score)、归一化互信息(normalized mutual information)和既往工作中使用的一种归一化互信息变体等信息恢复度量。我们的研究包含合成图与经验数据集,规模从1,000到1,000,000个节点不等。我们发现不同聚类质量度量的结果存在显著差异。例如,聚类算法在模块度上可能返回满分1分中的0.4,而在信息恢复上得分为0。我们发现传导率虽不完美,却是能最佳指示信息恢复度量性能的独立质量度量。我们的研究表明,既往工作中使用的归一化互信息变体不能想当然地认为仅与传统归一化互信息有微小差异。智能局部移动是本研究中最优表现的算法,但聚类评估度量间的差异使我们无法宣称其绝对优越。Louvain在几乎所有测试中表现优于Infomap,这与先前Infomap优于Louvain的工作结果相矛盾。我们发现尽管标签传播在聚类定义不明确时表现不佳,但其能高效且准确地扩展到具有明确聚类的大型图。

关键词

引用

@article{arxiv.1605.05797,
  title  = {Analysis of Network Clustering Algorithms and Cluster Quality Metrics at Scale},
  author = {Scott Emmons and Stephen Kobourov and Mike Gallant and Katy Börner},
  journal= {arXiv preprint arXiv:1605.05797},
  year   = {2016}
}