具有不可知标签选择偏差的去偏图神经网络
机器学习
2022-01-27 v2 人工智能
摘要
大多数现有图神经网络(GNNs)的提出未考虑数据中的选择偏差,即训练集与测试集间分布不一致。现实中,训练过程中甚至无法获得测试数据,使得选择偏差不可知。用有偏差的被选节点训练 GNN 会导致显著的参数估计偏差,并极大影响在测试节点上的泛化能力。本文中,我们首先给出实验研究,清晰表明选择偏差严重阻碍 GNN 的泛化能力,并从理论上证明选择偏差将导致 GNN 参数的有偏估计。接着,为消除 GNN 估计中的偏差,我们提出一种带差异化去相关正则化器的新型去偏图神经网络(DGNN)。该差异化去相关正则化器为每个有标签节点估计样本权重,从而可消除所学嵌入的伪相关。我们从因果视角分析该正则化器,其促使我们依据变量对混杂偏差的贡献来区分其权重。随后,这些样本权重被用于重加权 GNN 以消除估计偏差,从而有助于提升对未知测试节点预测的稳定性。我们在带有两类标签选择偏差的若干具挑战性图数据集上进行了全面实验。结果充分验证了我们所提模型优于最先进方法,且 DGNN 是增强现有 GNN 的灵活框架。
引用
@article{arxiv.2201.07708,
title = {Debiased Graph Neural Networks with Agnostic Label Selection Bias},
author = {Shaohua Fan and Xiao Wang and Chuan Shi and Kun Kuang and Nian Liu and Bai Wang},
journal= {arXiv preprint arXiv:2201.07708},
year = {2022}
}
备注
Accepted by TNNLS;12 pages