中文

Shift-Robust GNN:克服局部化图训练数据的局限性

机器学习 2021-10-28 v2

摘要

近期,针对半监督学习任务设计图神经网络(GNN)的研究兴趣激增。不幸的是,这些工作都假设用于训练的带标签节点是均匀随机选取的(即独立同分布样本)。然而,在许多现实场景中,为图节点收集标签既昂贵又固有地存在偏差——因此这一假设无法满足。当这种情况发生时,GNN 可能会因过拟合训练数据中存在的多余规律而导致泛化能力变差。在这项工作中,我们提出了一种名为 Shift-Robust GNN(SR-GNN)的方法,旨在解决有偏训练数据与图真实推断分布之间的分布差异。SR-GNN 使 GNN 模型适应于已提供训练标签的节点与数据集其余部分之间存在分布偏移的情况。我们通过在常见 GNN 半监督学习基准数据集上进行多种有偏训练数据集的实验,展示了 SR-GNN 的有效性。在这些实验中,我们看到 SR-GNN 在准确率上优于其他 GNN 基线,消除了由有偏训练数据引入的至少约 40% 的负面影响。在我们考虑的最大数据集 ogb-arxiv 上,我们观察到相对于基线有 2% 的绝对提升,并减少了 30% 的负面影响。

关键词

引用

@article{arxiv.2108.01099,
  title  = {Shift-Robust GNNs: Overcoming the Limitations of Localized Graph Training Data},
  author = {Qi Zhu and Natalia Ponomareva and Jiawei Han and Bryan Perozzi},
  journal= {arXiv preprint arXiv:2108.01099},
  year   = {2021}
}

备注

NeurIPS 2021