中文

THESAURUS:通过交换融合Gromov-Wasserstein耦合的对比图聚类

机器学习 2025-02-17 v3

摘要

图节点聚类是一项基本的无监督任务。现有方法通常通过自监督学习训练编码器,然后将K-means应用于编码器输出。一些方法直接使用此聚类结果作为最终分配,而另一些方法基于此初始聚类初始化质心,然后微调编码器和这些可学习质心。然而,由于它们依赖K-means,当编码器输出的聚类可分性较低时,这些方法继承了其缺点,面临均匀效应和聚类同化问题。我们总结了现有方法中聚类可分性低的三个原因:(1)缺乏上下文信息无法区分来自不同聚类的相似节点;(2)训练任务与下游聚类任务未充分对齐;(3)图结构中的聚类信息未被适当利用。为了解决这些问题,我们提出了通过交换融合Gromov-Wasserstein耦合的对比图聚类(THESAURUS)。我们的方法引入语义原型以提供上下文信息,并采用与下游聚类任务良好对齐的跨视图分配预测预训练任务。此外,它利用Gromov-Wasserstein最优传输(GW-OT)以及所提出的原型图来充分利用图结构中的聚类信息。为了适应多样化的真实世界数据,THESAURUS通过动量更新原型图和OT中的原型边际分布。大量实验表明,THESAURUS比现有技术实现了更高的聚类可分性,有效缓解了均匀效应和聚类同化问题。

关键词

引用

@article{arxiv.2412.11550,
  title  = {THESAURUS: Contrastive Graph Clustering by Swapping Fused Gromov-Wasserstein Couplings},
  author = {Bowen Deng and Tong Wang and Lele Fu and Sheng Huang and Chuan Chen and Tao Zhang},
  journal= {arXiv preprint arXiv:2412.11550},
  year   = {2025}
}

备注

Accepted by AAAI 2025