图上的自监督学习:深度洞察与新方向
机器学习
2020-06-19 v1 机器学习
摘要
深度学习的成功众所周知需要大量昂贵的标注数据。这促使了自监督学习(SSL)的发展,其旨在通过在无标注数据上构建特定领域的代理任务来缓解这一限制。同时,以图神经网络(GNNs)的形式将深度学习推广到图领域的兴趣日益增长。GNNs可以通过简单的邻域聚合自然地利用无标注节点,但这种方式无法充分利用无标注节点。因此,我们寻求将SSL用于GNNs以充分挖掘无标注数据。不同于图像和文本领域的数据实例,图中的节点呈现独特的结构信息且天然相互关联,表明其并非独立同分布(或i.i.d.)。这种复杂性对于图上的SSL而言是一把双刃剑。一方面,它决定了从图像和文本领域采用解决方案到图上是具有挑战性的,需要专门的努力。另一方面,它提供了丰富的信息,使我们能够从多种视角构建SSL。因此,在本文中,我们通过实证研究了图上大量基础的SSL代理任务,首先加深了对SSL与GNNs在何时、为何以及哪些策略起作用的理解。受实证研究的深度洞察启发,我们提出了新方向SelfTask来构建先进的代理任务,能够在各种真实世界数据集上取得最先进的性能。复现我们结果的具体实验设置可在\url{https://github.com/ChandlerBang/SelfTask-GNN}找到。
引用
@article{arxiv.2006.10141,
title = {Self-supervised Learning on Graphs: Deep Insights and New Direction},
author = {Wei Jin and Tyler Derr and Haochen Liu and Yiqi Wang and Suhang Wang and Zitao Liu and Jiliang Tang},
journal= {arXiv preprint arXiv:2006.10141},
year = {2020}
}