中文

大规模属性图上的高效可扩展聚类

社会与信息网络 2021-09-21 v2 机器学习

摘要

给定图 G,其中每个节点关联一组属性,以及指定输出簇数的参数 k,k-属性图聚类(k-AGC)将 G 中的节点划分为 k 个不相交簇,使得同一簇内节点共享相似的拓扑与属性特征,而不同簇间节点不相似。该问题在大规模图(例如数百万节点、数十亿边)上极具挑战。对于此类图,现有方案要么代价过高,要么产生的聚类结果质量受损。本文提出 ACMin,一种针对 k-AGC 的有效方法,可产出高质量簇且代价与输入图 G 的规模呈线性关系。ACMin 的主要贡献有两点:(i) 基于为本问题定制的属性多跳 conductance 质量度量对 k-AGC 问题进行新颖表述,其有效从拓扑邻近与属性相似两方面刻画簇一致性;(ii) 一种线性时间优化求解器,基于正交迭代、交替优化等高效矩阵运算以及显著加速 ACMin 实际收敛的初始化技术,迭代获得高质量簇。在 6 个真实数据集上与 11 个竞争对手的广泛实验表明,ACMin 在针对真值标签衡量的结果质量上始终优于所有竞争对手,同时快达数个数量级。特别是在具有 2.652 亿条边和 11 亿属性值的 Microsoft Academic Knowledge Graph 数据集上,ACMin 使用单 CPU 核在 1.68 小时内输出 5-AGC 的高质量结果,而 11 个竞争对手无一在 3 天内完成。

关键词

引用

@article{arxiv.2102.03826,
  title  = {Effective and Scalable Clustering on Massive Attributed Graphs},
  author = {Renchi Yang and Jieming Shi and Yin Yang and Keke Huang and Shiqi Zhang and Xiaokui Xiao},
  journal= {arXiv preprint arXiv:2102.03826},
  year   = {2021}
}

备注

This is the full version of the paper appearing in TheWebConf 2021. The DOI assigned: https://doi.org/10.1145/3442381.3449875