理解模型服务应用中硬件加速通信的优势
性能
2023-07-11 v2
摘要
人们通常认为,边缘卸载的端到端网络性能纯粹由终端设备与边缘计算设施之间的网络连接性能决定,而 5G/6G 网络技术的持续创新可对此提供帮助。然而,随着边缘卸载计算复杂度的日益增长以及动态负载均衡需求的出现,一个被卸载的任务往往要经过一个多阶段流水线,该流水线跨越给定边缘计算设施内通过专用网络 fabric 互联的多个计算节点与代理。随着 RDMA 与 GPUDirect RDMA 等最新硬件加速传输技术被用于构建此类网络 fabric,有必要深入理解这些技术在计算卸载场景下的全部潜力,以及 GPU 调度和计算特征等不同因素对这些技术所能实现的净性能增益的影响。本文揭示了典型基于机器学习(ML)的计算流水线中延迟开销的详细见解,并分析了采用硬件加速通信的潜在益处。为此,我们构建了一个支持多种通信机制的模型服务框架。利用该框架,我们识别了最先进模型服务流水线中的性能瓶颈,并展示了硬件加速通信如何缓解这些瓶颈。例如,我们表明 GPUDirect RDMA 可节省 15–50% 的模型服务延迟,相当于 70–160 ms。
引用
@article{arxiv.2305.03165,
title = {Understanding the Benefits of Hardware-Accelerated Communication in Model-Serving Applications},
author = {Walid A. Hanafy and Limin Wang and Hyunseok Chang and Sarit Mukherjee and T. V. Lakshman and Prashant Shenoy},
journal= {arXiv preprint arXiv:2305.03165},
year = {2023}
}