arXiv4TGC:面向时序图聚类的大规模数据集
人工智能
2023-06-09 v1 机器学习
摘要
时序图聚类(TGC)是时序图学习中的一项关键任务。其重点在于时序图上的节点聚类,并且由于时序图方法的机制,它对大规模图结构提供了更大的灵活性。然而,TGC 的发展目前受到一个显著问题的制约:缺乏合适且可靠的大规模时序图数据集来评估聚类性能。换言之,大多数现有的时序图数据集规模较小,即便是大规模数据集也仅包含有限数量的可用节点标签。这使得评估大规模时序图聚类模型变得具有挑战性。为应对这一挑战,我们构建了 arXiv4TGC,一组用于大规模时序图聚类的新型学术数据集(包括 arXivAI、arXivCS、arXivMath、arXivPhy 和 arXivLarge)。特别地,最大的数据集 arXivLarge 包含 130 万个带标签的可用节点和 1000 万条时序边。我们进一步在以往经典的时序图数据集和本文提出的新数据集上,使用典型的时序图学习模型比较了聚类性能。arXiv4TGC 上的聚类性能能更明显地用于评估不同模型,从而产生更高的聚类置信度,且更适用于大规模时序图聚类。arXiv4TGC 数据集公开于:https://github.com/MGitHubL/arXiv4TGC。
引用
@article{arxiv.2306.04962,
title = {arXiv4TGC: Large-Scale Datasets for Temporal Graph Clustering},
author = {Meng Liu and Ke Liang and Yue Liu and Siwei Wang and Sihang Zhou and Xinwang Liu},
journal= {arXiv preprint arXiv:2306.04962},
year = {2023}
}