基于 FPGA 的 AI 智能网卡用于可扩展分布式 AI 训练系统
分布式、并行与集群计算
2022-04-26 v1 人工智能
摘要
人工智能(AI)技术的快速进展在许多应用域带来了准确性的显著提升,代价是更大且计算更密集的模型。在海量数据上训练此类模型通常需要扩展到许多计算节点,并严重依赖全归约(all-reduce)等集体通信算法在不同节点间交换权重梯度。在分布式 AI 训练系统中,这些集体通信操作的开销会瓶颈化其性能,且随节点数增加效应更显著。在本文中,我们首先通过剖析分布式 AI 训练刻画全归约操作开销。然后,我们提出一种用于分布式 AI 训练系统的新型智能网络接口卡(NIC),使用现场可编程门阵列(FPGA)加速全归约操作并通过数据压缩优化网络带宽利用。该 AI 智能网卡释放系统的计算资源以执行计算更密集的张量操作,并提升整体节点间通信效率。我们在一个由 6 个计算节点组成的原型分布式 AI 训练系统上进行实测,以评估所提基于 FPGA 的 AI 智能网卡相较使用常规 NIC 的基线系统的性能增益。我们还利用这些测量验证了我们为预测扩展至更大系统时的性能而建立的分析模型。相较使用传统 NIC 的基线系统,我们提出的基于 FPGA 的 AI 智能网卡在 6 节点时整体训练性能提升 1.6 倍,在 32 节点时预计提升 2.5 倍。
引用
@article{arxiv.2204.10943,
title = {FPGA-based AI Smart NICs for Scalable Distributed AI Training Systems},
author = {Rui Ma and Evangelos Georganas and Alexander Heinecke and Andrew Boutros and Eriko Nurvitadhi},
journal= {arXiv preprint arXiv:2204.10943},
year = {2022}
}
备注
5 pages, 4 figures