用于快速 GNN 训练的可证明收敛子图采样
机器学习
2024-08-22 v2
摘要
子图采样——一类用于图神经网络(GNNs)的小批量训练技术——对真实应用至关重要。在 GNN 的消息传递(MP)过程中,子图采样方法在反向传播中丢弃小批量之外的消息,以避免著名的邻居爆炸问题,即节点依赖随 MP 迭代次数呈指数增长。然而,丢弃消息可能牺牲梯度估计精度,对其收敛分析与收敛速度提出重大挑战。为应对此挑战,我们提出一种具有收敛保证的新型子图采样方法,即局部消息补偿(LMC)。据我们所知,LMC 是首个可证明收敛的子图采样方法。其关键思想是基于反向传递的消息传递公式,在反向传播中检索被丢弃的消息。通过对前向与反向传递中被丢弃消息的高效且有效的补偿,LMC 计算出准确的小批量梯度,从而加速收敛。此外,LMC 适用于多种基于 MP 的 GNN 架构,包括卷积 GNN(具有不同层的有限消息传递迭代)与循环 GNN(具有共享层的无限消息传递迭代)。在大规模基准上的实验表明,LMC 显著快于最先进的子图采样方法。
引用
@article{arxiv.2303.11081,
title = {Provably Convergent Subgraph-wise Sampling for Fast GNN Training},
author = {Jie Wang and Zhihao Shi and Xize Liang and Defu Lian and Shuiwang Ji and Bin Li and Enhong Chen and Feng Wu},
journal= {arXiv preprint arXiv:2303.11081},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2302.00924