中文

CARL-G:图上聚类加速的表示学习

机器学习 2023-08-02 v2

摘要

图上的自监督学习在各种下游任务中取得了巨大进展。然而,许多最先进的方法受到若干障碍的制约,阻碍了其充分发挥潜力。例如,对比方法通常需要负采样,而这往往在計算上代价高昂。虽然非对比方法避免了这一昂贵步骤,但大多数现有方法要么依赖过于复杂的架构,要么依赖特定于数据集的增强。在本文中,我们提出一个问题:我们能否借鉴经典的 unsupervised 机器学习文献来克服这些障碍?受我们的关键洞察指导,即基于距离的聚类目标与对比学习的目标高度相似:两者都试图将相似项的表示拉到一起、将不相似项的表示分开。因此,我们提出了 CARL-G——一种新颖的基于聚类的图表示学习框架,它使用受聚类验证指标(CVI,即簇质量的内在度量,无需真实标签)启发的损失。CARL-G 可适配不同的聚类方法和 CVI,并且我们表明,在正确选择聚类方法和 CVI 的情况下,CARL-G 在 4/5 的数据集上优于节点分类基线,与性能最佳的基线相比训练加速高达 79 倍。CARL-G 在节点聚类和相似度搜索任务中也达到或与基线持平或更优,训练比性能最佳的基线快达 1,500 倍。最后,我们还为在图表示学习中使用受 CVI 启发的损失提供了理论基础。

关键词

引用

@article{arxiv.2306.06936,
  title  = {CARL-G: Clustering-Accelerated Representation Learning on Graphs},
  author = {William Shiao and Uday Singh Saini and Yozen Liu and Tong Zhao and Neil Shah and Evangelos E. Papalexakis},
  journal= {arXiv preprint arXiv:2306.06936},
  year   = {2023}
}

备注

14 pages. Accepted at KDD 2023