中文

面向自监督 GNN 的联合可学习数据增强

机器学习 2021-08-25 v1 社会与信息网络

摘要

自监督学习 (SSL) 旨在不依赖人工标注的情况下学习对象的表示。近期,许多用于图表示学习的 SSL 方法已取得与 SOTA 半监督 GNN 相当的性能。这些方法中流行的架构是依赖于数据增强的孪生网络。然而,这些方法依赖于启发式设计的数据增强技术。此外,它们使用对比项或其他技巧(例如,不对称性)来避免孪生网络中可能出现的平凡解。在本研究中,我们提出了 GraphSurgeon,一种新颖的 GNN SSL 方法,具有以下特点。首先,我们提出了一种可学习的数据增强方法,该方法通过利用图中编码的固有信号,与嵌入联合学习,而非依赖启发式方法。此外,我们利用可学习数据增强的灵活性,引入了一种在嵌入空间中进行增强的新策略,称为后增强。该策略具有显著更低的内存开销和运行时成本。其次,由于采样真正的对比项很困难,我们避免了显式的负采样。第三,我们不依赖工程技巧,而是使用一个受拉普拉斯特征映射启发的可扩展约束优化目标来避免平凡解。为了验证 GraphSurgeon 的实际应用,我们使用 14 个公开数据集进行了实证评估,这些数据集跨越多个领域,规模从小型到具有数亿条边的大型图。我们的发现表明,在节点分类任务中,GraphSurgeon 与六个 SOTA 半监督基线方法相当,并与五个 SOTA 自监督基线方法持平。源代码可在 https://github.com/zekarias-tilahun/graph-surgeon 获取。

关键词

引用

@article{arxiv.2108.10420,
  title  = {Jointly Learnable Data Augmentations for Self-Supervised GNNs},
  author = {Zekarias T. Kefato and Sarunas Girdzijauskas and Hannes Stärk},
  journal= {arXiv preprint arXiv:2108.10420},
  year   = {2021}
}

备注

Under Review