置信度或致误导:分布偏移下图神经网络的自训练
机器学习
2022-01-28 v1 人工智能
摘要
图卷积网络(GCNs)近来引起广泛关注,并在图上取得了最先进的性能,但其成功通常依赖于使用大量昂贵且耗时的标注数据进行细致训练。为缓解标注数据稀缺问题,自训练方法通过在图上标注高置信度无标签节点并将其加入训练步骤而得到广泛应用。在此脉络下,我们对图上现有的自训练方法进行了实证性的深入研究。令人惊讶的是,我们发现高置信度无标签节点并非总是有用,甚至会通过自训练引入原始标注数据集与增广数据集之间的分布偏移问题,严重阻碍图上自训练的能力。为此,本文提出一种新颖的分布恢复图自训练框架(DR-GST),该框架可恢复原始标注数据集的分布。具体而言,我们首先证明在分布偏移情形下的自训练框架损失函数与总体分布下的损失函数在每个伪标签节点被适当系数加权时相等。考虑到该系数难以处理,我们进而提出以信息增益替代该系数,观察到二者具有相同的变化趋势;其中信息增益在 DR-GST 中分别通过 dropout 变分推断与 dropedge 变分推断进行估计。然而,这样的加权损失函数会放大错误伪标签的影响。因此,我们应用损失校正方法来改善伪标签的质量。我们的理论分析与在五个基准数据集上的大量实验均证明了所提 DR-GST 及其各精心设计组件的有效性。
引用
@article{arxiv.2201.11349,
title = {Confidence May Cheat: Self-Training on Graph Neural Networks under Distribution Shift},
author = {Hongrui Liu and Binbin Hu and Xiao Wang and Chuan Shi and Zhiqiang Zhang and Jun Zhou},
journal= {arXiv preprint arXiv:2201.11349},
year = {2022}
}
备注
Accepted to the ACM Web Conference (WWW)2022. Work done during internship at Ant Group