学术与产业间的桥梁:面向归因图聚类的综合基准
机器学习
2026-02-10 v1
摘要
归因图聚类(AGC)是一种基础的无监督任务,融合结构拓扑与节点属性,以揭示图结构数据中潜在模式。尽管其在反欺诈和用户细分等工业应用中具有重要意义,但当前评估协议仍存在显著鸿沟:数据规模较小且同质性高的引文数据集、不可扩展的全批处理范式,以及依赖监督指标且无法反映标签稀缺环境中性能的局限。为弥合这些差距,我们提出PyAGC:一个全面且生产就绪的基准与库,旨在跨越多样规模和结构特性对AGC方法进行压力测试。我们将现有方法统一为模块化的编码-聚类-优化框架,并首次提供面向广泛SOTA AGC算法的内存高效 mini-batch 实现。本基准精选12个多样数据集,规模从2.7K节点扩展至1.11亿节点,特别包含复杂表格特征且同质性较低的工业图。此外,我们主张采用全面的评估协议,要求在传统监督指标之外,强制使用无监督结构指标和效率分析。该基准已在阿里巴巴集团的高风险工业工作流程中实战检验,为社区提供了一个稳健、可复现且可扩展的平台,推动AGC研究向真实部署迈进。代码与资源已公开于GitHub(https://github.com/Cloudy1225/PyAGC)、PyPI(https://pypi.org/project/pyagc)及文档(https://pyagc.readthedocs.io)。
引用
@article{arxiv.2602.08519,
title = {Bridging Academia and Industry: A Comprehensive Benchmark for Attributed Graph Clustering},
author = {Yunhui Liu and Pengyu Qiu and Yu Xing and Yongchao Liu and Peng Du and Chuntao Hong and Jiajun Zheng and Tao Zheng and Tieke He},
journal= {arXiv preprint arXiv:2602.08519},
year = {2026}
}