中文

分布式图上的可扩展神经网络训练

机器学习 2024-02-13 v3 人工智能 信息检索

摘要

图神经网络(GNNs)支撑着涉及图结构数据的多种机器学习任务,从预测蛋白质结构到提供个性化推荐。现实世界中的图数据通常必须分布式存储在多台机器上,这不仅是因为容量限制,还因为需要遵守数据驻留或隐私法规。在此类设置中,网络通信代价高昂,并成为训练 GNNs 的主要瓶颈。迄今为止,分布式 GNN 训练的优化主要针对数据层面的改进——通过缓存、网络感知分区和子采样——这些适用于类似数据中心的环境,其中图数据可由单一实体访问且数据传输成本被忽略。我们提出 RETEXO,这是首个在尊重任意给定数据分区配置的同时消除分布式 GNN 训练中严重通信瓶颈的框架。其关键在于一种新训练过程——惰性消息传递(lazy message passing),它重新排序了 GNN 元素的训练序列。与标准 GNN 训练相比,RETEXO 在网络数据成本上实现了 1-2 个数量级的降低,同时保持了精度。RETEXO 随去中心化程度增加和带宽降低而优雅地扩展。它是首个可用于在所有网络去中心化级别训练 GNNs 的框架——包括集中式数据中心网络、广域网、邻近网络和边缘网络。

关键词

引用

@article{arxiv.2302.13053,
  title  = {Scalable Neural Network Training over Distributed Graphs},
  author = {Aashish Kolluri and Sarthak Choudhary and Bryan Hooi and Prateek Saxena},
  journal= {arXiv preprint arXiv:2302.13053},
  year   = {2024}
}