中文

基于稀疏语义的对比-重建异构图表示学习

机器学习 2025-06-10 v1

摘要

在图自监督学习中,掩码自编码器(MAE)和对比学习(CL)是两个突出的范式。MAE侧重于重建被掩码的元素,而CL则最大化增强图视图之间的相似性。最近的研究强调了它们的互补性:MAE在局部特征捕获方面表现突出,CL在全局信息提取方面更优。针对均质图的混合框架已有所提出,但面临在设计满足两种任务语义要求的共享编码器方面的挑战。在语义稀疏的情况下,CL在视图构建方面难题,正负样本之间的梯度不平衡问题仍然存在。本文引入HetCRF,一种用于异构图的双通道自监督学习框架。HetCRF采用两阶段聚合策略适应嵌入语义,能够与MAE和CL兼容。为解决语义稀疏问题,它通过增强编码器输出用于视图构建,而非依赖原始特征,提高了效率。还提出了两种正样本增强策略来平衡梯度贡献。在四个真实世界的异构图数据集上进行节点分类实验,证明HetCRF在超越最先进基线方面具有优势。在节点特征缺失的数据集上,如Aminer和Freebase,在节点分类中以40%的标签率时,HetCRF相对于第二名基线的Macro-F1得分分别提高了2.75%和2.2%,验证了其有效性和优越性。

关键词

引用

@article{arxiv.2506.06682,
  title  = {Learning Robust Heterogeneous Graph Representations via Contrastive-Reconstruction under Sparse Semantics},
  author = {Di Lin and Wanjing Ren and Xuanbin Li and Rui Zhang},
  journal= {arXiv preprint arXiv:2506.06682},
  year   = {2025}
}