中文

基于正交拓扑片上网络的HBM型FPGA上GCN训练的高效消息传递架构

硬件体系结构 2024-11-07 v1 机器学习

摘要

图卷积网络(GCNs)是图表示学习中最先进的深度学习模型。然而,GCN 的高效训练受到内存容量和带宽的限制,加之不规则的数据流导致通信瓶颈。为应对这些挑战,我们提出了一种消息传递架构,利用 NUMA 的内存访问特性,并在加速器内部采用基于 4 维超立方体网络的并行多播路由算法,以实现图中高效的消息传递。此外,我们重新设计了所提加速器中专用于 GCN 的反向传播算法。该重新设计策略性地缓解了训练阶段普遍存在的内存需求,并降低了大规模矩阵转置带来的计算开销。与最先进的 HP-GNN 架构相比,我们实现了 1.03×1.81×1.03\times \sim 1.81\times 的性能提升。

关键词

引用

@article{arxiv.2411.03857,
  title  = {Efficient Message Passing Architecture for GCN Training on HBM-based FPGAs with Orthogonal Topology On-Chip Networks},
  author = {Qizhe Wu and Letian Zhao and Yuchen Gui and Huawen Liang Xiaotian Wang},
  journal= {arXiv preprint arXiv:2411.03857},
  year   = {2024}
}

备注

This paper has been accepted for 2024 ACM/SIGDA International Symposium on Field Programmable Gate Arrays(FPGA'24) as poster