图卷积网络中与节点度相关偏差的探究与缓解
机器学习
2020-08-14 v2 机器学习
摘要
图卷积网络(GCNs)在图上的半监督学习任务中展现出有前景的结果,因而相比其他方法更受青睐。尽管 GCNs 取得了显著成功,但在监督不足的情况下难以训练。当标注数据有限时,GCNs 对低度节点的表现不尽如人意。虽然已有一些前期工作从整体模型层面分析了 GCNs 的成功与失败,但在单个节点层面对 GCNs 进行剖析仍鲜有探索。本文中,我们依据节点度分布对 GCNs 进行分析。从经验观察到理论证明,我们确认 GCNs 偏向于度较大的节点,在这些节点上准确率更高,即便高度节点在大多数图中占比偏低。我们进一步提出了一种新颖的自监督学习度特定 GCN(SL-DSGC),从模型和数据两方面缓解 GCNs 的与度相关偏差。首先,我们提出一种度特定 GCN 层,捕捉不同度节点的差异与相似性,从而减少 GCNs 因与所有节点共享相同参数而引起的模型内部偏差。其次,我们设计了一种自监督学习算法,利用贝叶斯神经网络为无标注节点生成带不确定性分数的伪标签。伪标签增加了低度节点连接到标注邻居的机会,从而从数据角度减少 GCNs 的偏差。不确定性分数进一步被用于在对 SL-DSGC 的随机梯度下降中动态加权伪标签。在三个基准数据集上的实验表明,SL-DSGC 不仅优于最先进的自训练/自监督学习 GCN 方法,还大幅提升了 GCN 对低度节点的准确率。
引用
@article{arxiv.2006.15643,
title = {Investigating and Mitigating Degree-Related Biases in Graph Convolutional Networks},
author = {Xianfeng Tang and Huaxiu Yao and Yiwei Sun and Yiqi Wang and Jiliang Tang and Charu Aggarwal and Prasenjit Mitra and Suhang Wang},
journal= {arXiv preprint arXiv:2006.15643},
year = {2020}
}
备注
Accepted to CIKM 2020