中文

用于快速 GNN 训练的可证明收敛子图采样

机器学习 2024-08-22 v2

摘要

子图采样——一类用于图神经网络(GNNs)的小批量训练技术——对真实应用至关重要。在 GNN 的消息传递(MP)过程中,子图采样方法在反向传播中丢弃小批量之外的消息,以避免著名的邻居爆炸问题,即节点依赖随 MP 迭代次数呈指数增长。然而,丢弃消息可能牺牲梯度估计精度,对其收敛分析与收敛速度提出重大挑战。为应对此挑战,我们提出一种具有收敛保证的新型子图采样方法,即局部消息补偿(LMC)。据我们所知,LMC 是首个可证明收敛的子图采样方法。其关键思想是基于反向传递的消息传递公式,在反向传播中检索被丢弃的消息。通过对前向与反向传递中被丢弃消息的高效且有效的补偿,LMC 计算出准确的小批量梯度,从而加速收敛。此外,LMC 适用于多种基于 MP 的 GNN 架构,包括卷积 GNN(具有不同层的有限消息传递迭代)与循环 GNN(具有共享层的无限消息传递迭代)。在大规模基准上的实验表明,LMC 显著快于最先进的子图采样方法。

关键词

引用

@article{arxiv.2303.11081,
  title  = {Provably Convergent Subgraph-wise Sampling for Fast GNN Training},
  author = {Jie Wang and Zhihao Shi and Xize Liang and Defu Lian and Shuiwang Ji and Bin Li and Enhong Chen and Feng Wu},
  journal= {arXiv preprint arXiv:2303.11081},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2302.00924