中文

剔除虚假子图以实现图结构数据集外分布泛化

机器学习 2025-09-09 v4

摘要

图神经网络 (GNN) 在训练数据与测试数据之间的分布迁移情况下常常会出现显著的性能下降,这限制了其在现实场景中的应用。近期研究提出了各种方法来应对数据集外分布泛化挑战,但图域方法多聚焦于直接识别目标标签具有预测性的不变子图。然而我们认为,直接从不变子图中识别边的做法在某些伪相关边与目标标签强相关时具有较大挑战和易出错的风险。本文提出了 PrunE,首个基于剔除虚假边以提升数据集外分布泛化性的方法。通过剔除虚假边,PrunE 能够更全面地保留不变子图,这对于数据集外分布泛化至关重要。具体而言,PrunE 采用两种正则化项来剔除虚假边:1) 图规模约束以排除信息不足的虚假边,2) ϵ\epsilon-概率对齐进一步抑制虚假边的发生。通过理论分析和大量实验,我们展示 PrunE 在数据集外性能方面显著优于以往的领先方法。代码已公开:https://github.com/tianyao-aka/PrunE-GraphOOD。

关键词

引用

@article{arxiv.2506.05957,
  title  = {Pruning Spurious Subgraphs for Graph Out-of-Distribution Generalization},
  author = {Tianjun Yao and Haoxuan Li and Yongqiang Chen and Tongliang Liu and Le Song and Eric Xing and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2506.05957},
  year   = {2025}
}

备注

26 pages, 8 figures