基于分布一致性的稀疏标签图神经网络自训练
机器学习
2024-01-22 v1 人工智能
摘要
由于监督不足以及标记节点与未标记节点之间潜在的分布偏移,少样本节点分类对图神经网络(GNNs)构成了重大挑战。自训练已成为利用大量未标记数据的广泛流行框架,它通过为选定的未标记节点分配伪标签来扩展训练集。已有研究致力于开发基于置信度、信息增益等的各种选择策略。然而,这些方法均未考虑训练节点集与测试节点集之间的分布偏移。伪标签步骤可能会放大这种偏移甚至引入新的偏移,从而阻碍自训练的有效性。因此,在本工作中,我们探索了在自训练过程中显式弥合扩展训练集与测试集之间分布偏移的潜力。为此,我们提出了一种新颖的分布一致图自训练(DC-GST)框架,以识别既具信息量又能弥补分布差异的伪标签节点,并将其表述为一个可微优化任务。进一步采用了一种分布偏移感知的边预测器来扩充图,并提高模型在分配伪标签时的泛化能力。我们在四个公开可用的基准数据集上评估了所提出的方法,大量实验表明我们的框架始终优于SOTA基线。
引用
@article{arxiv.2401.10394,
title = {Distribution Consistency based Self-Training for Graph Neural Networks with Sparse Labels},
author = {Fali Wang and Tianxiang Zhao and Suhang Wang},
journal= {arXiv preprint arXiv:2401.10394},
year = {2024}
}
备注
Accepted by WSDM 2024