基于正交拓扑片上网络的HBM型FPGA上GCN训练的高效消息传递架构
硬件体系结构
2024-11-07 v1 机器学习
摘要
图卷积网络(GCNs)是图表示学习中最先进的深度学习模型。然而,GCN 的高效训练受到内存容量和带宽的限制,加之不规则的数据流导致通信瓶颈。为应对这些挑战,我们提出了一种消息传递架构,利用 NUMA 的内存访问特性,并在加速器内部采用基于 4 维超立方体网络的并行多播路由算法,以实现图中高效的消息传递。此外,我们重新设计了所提加速器中专用于 GCN 的反向传播算法。该重新设计策略性地缓解了训练阶段普遍存在的内存需求,并降低了大规模矩阵转置带来的计算开销。与最先进的 HP-GNN 架构相比,我们实现了 的性能提升。
引用
@article{arxiv.2411.03857,
title = {Efficient Message Passing Architecture for GCN Training on HBM-based FPGAs with Orthogonal Topology On-Chip Networks},
author = {Qizhe Wu and Letian Zhao and Yuchen Gui and Huawen Liang Xiaotian Wang},
journal= {arXiv preprint arXiv:2411.03857},
year = {2024}
}
备注
This paper has been accepted for 2024 ACM/SIGDA International Symposium on Field Programmable Gate Arrays(FPGA'24) as poster