中文

DiskGNN:弥合核外 GNN 训练的 I/O 效率与模型精度

机器学习 2025-02-18 v2

摘要

图神经网络(GNN)是专门用于图数据的机器学习模型,广泛应用于许多应用中。为了在超出 CPU 内存的大型图上训练 GNN,一些系统将数据存储在磁盘上并进行核外处理。然而,这些系统要么在读取通常小于磁盘页的节点特征时存在读放大,要么由于将图视为断开的分区而导致模型精度下降。为了弥补这一差距,我们构建了一个名为 DiskGNN 的系统,它实现了高 I/O 效率,从而在不损害模型精度的情况下实现快速训练。DiskGNN 使用的关键技术是离线采样,它有助于将图采样与模型计算解耦。具体而言,通过事先进行图采样,DiskGNN 获取了模型计算将要访问的节点特征,并利用此信息将目标节点特征连续打包在磁盘上,以避免读放大。此外,DiskGNN 还采用了包括四级特征存储(以充分利用内存层次结构来缓存节点特征并减少磁盘访问)、批量打包(以加速特征打包过程)和流水线训练(以将磁盘访问与其他操作重叠)的设计。我们将 DiskGNN 与 Ginex 和 MariusGNN 进行了比较,它们是最先进的核外 GNN 训练系统。结果表明,DiskGNN 可以将基线加速 8 倍以上,同时保持其最佳模型精度。

关键词

引用

@article{arxiv.2405.05231,
  title  = {DiskGNN: Bridging I/O Efficiency and Model Accuracy for Out-of-Core GNN Training},
  author = {Renjie Liu and Yichuan Wang and Xiao Yan and Haitian Jiang and Zhenkun Cai and Minjie Wang and Bo Tang and Jinyang Li},
  journal= {arXiv preprint arXiv:2405.05231},
  year   = {2025}
}