中文

Quiver:利用工作负载感知支持 GPU 实现低延迟、高吞吐的 GNN 服务

分布式、并行与集群计算 2023-05-19 v1 人工智能 机器学习 操作系统

摘要

用于图神经网络(GNN)推理请求服务的系统必须兼顾低延迟与高吞吐,但由于采样图节点数与聚合 GNN 特征数的偏斜,其面临不规则计算。这使得有效利用 GPU 颇具挑战:仅用 GPU 采样少量图节点比基于 CPU 的采样性能更低;而聚合大量特征在 GPU 与 CPU 间表现出高昂的数据搬运成本。因此,当前 GNN 服务系统使用 CPU 进行图采样与特征聚合,限制了吞吐。我们描述了 Quiver,一个分布式、基于 GPU 且低延迟高吞吐的 GNN 服务系统。Quiver 的核心思想是借助工作负载度量预测 GNN 请求的不规则计算,并据此调度 GPU 用于图采样与特征聚合:(1)对于图采样,Quiver 计算概率采样图大小,这一度量可预测图采样的并行度。Quiver 利用该度量仅在性能收益超过基于 CPU 的采样时才将采样任务分配给 GPU;(2)对于特征聚合,Quiver 依赖特征访问概率来决定在分布式 GPU NUMA 拓扑中跨节点划分与复制哪些特征。我们展示 Quiver 相较 SOTA GNN 方案(DGL 与 PyG)实现了最高 35 倍更低延迟与 8 倍更高吞吐。

关键词

引用

@article{arxiv.2305.10863,
  title  = {Quiver: Supporting GPUs for Low-Latency, High-Throughput GNN Serving with Workload Awareness},
  author = {Zeyuan Tan and Xiulong Yuan and Congjie He and Man-Kit Sit and Guo Li and Xiaoze Liu and Baole Ai and Kai Zeng and Peter Pietzuch and Luo Mai},
  journal= {arXiv preprint arXiv:2305.10863},
  year   = {2023}
}