CARL-G:图上聚类加速的表示学习
机器学习
2023-08-02 v2
摘要
图上的自监督学习在各种下游任务中取得了巨大进展。然而,许多最先进的方法受到若干障碍的制约,阻碍了其充分发挥潜力。例如,对比方法通常需要负采样,而这往往在計算上代价高昂。虽然非对比方法避免了这一昂贵步骤,但大多数现有方法要么依赖过于复杂的架构,要么依赖特定于数据集的增强。在本文中,我们提出一个问题:我们能否借鉴经典的 unsupervised 机器学习文献来克服这些障碍?受我们的关键洞察指导,即基于距离的聚类目标与对比学习的目标高度相似:两者都试图将相似项的表示拉到一起、将不相似项的表示分开。因此,我们提出了 CARL-G——一种新颖的基于聚类的图表示学习框架,它使用受聚类验证指标(CVI,即簇质量的内在度量,无需真实标签)启发的损失。CARL-G 可适配不同的聚类方法和 CVI,并且我们表明,在正确选择聚类方法和 CVI 的情况下,CARL-G 在 4/5 的数据集上优于节点分类基线,与性能最佳的基线相比训练加速高达 79 倍。CARL-G 在节点聚类和相似度搜索任务中也达到或与基线持平或更优,训练比性能最佳的基线快达 1,500 倍。最后,我们还为在图表示学习中使用受 CVI 启发的损失提供了理论基础。
引用
@article{arxiv.2306.06936,
title = {CARL-G: Clustering-Accelerated Representation Learning on Graphs},
author = {William Shiao and Uday Singh Saini and Yozen Liu and Tong Zhao and Neil Shah and Evangelos E. Papalexakis},
journal= {arXiv preprint arXiv:2306.06936},
year = {2023}
}
备注
14 pages. Accepted at KDD 2023