图神经网络链路预测中的陷阱:理解目标链路包含的影响与更佳实践
机器学习
2023-12-19 v2 信息检索
社会与信息网络
摘要
尽管图神经网络(GNN)在众多高影响力应用中取得了显著成功,但我们证明,在链路预测中,将待预测边在训练和/或测试时包含在图中的常见做法对低度节点的性能有巨大影响。我们从理论和经验上研究了这些做法如何影响不同度数下的节点级性能。具体而言,我们探讨了出现的三个问题:(I1)过拟合;(I2)分布偏移;以及(I3)隐式测试泄漏。前两个问题导致对测试数据的泛化性差,而后者导致对模型性能的高估,并直接影响 GNN 的部署。为了系统地解决这些问题,我们引入了一个有效且高效的 GNN 训练框架 SpotTarget,它利用了我们对低度节点的洞察:(1)在训练时,如果待预测的(训练)边连接到至少一个低度节点,则将其排除;(2)在测试时,排除所有待预测的测试边(从而模拟使用 GNN 的真实场景,其中测试数据不包含在图中)。SpotTarget 帮助研究人员和从业者遵循从图数据中学习的最佳实践,而这些实践即使是最广泛使用的框架也经常忽略。我们在各种真实世界数据集上的实验表明,SpotTarget 使 GNN 在稀疏图中的准确率提高达 15 倍,并显著改善了其在稠密图中低度节点的性能。
引用
@article{arxiv.2306.00899,
title = {Pitfalls in Link Prediction with Graph Neural Networks: Understanding the Impact of Target-link Inclusion & Better Practices},
author = {Jing Zhu and Yuhang Zhou and Vassilis N. Ioannidis and Shengyi Qian and Wei Ai and Xiang Song and Danai Koutra},
journal= {arXiv preprint arXiv:2306.00899},
year = {2023}
}
备注
Extended Version of our WSDM'24 paper. 8 pages, 2 page appendix