FaST-GShare:面向无服务器计算深度学习推理的高效时空GPU共享机制
分布式、并行与集群计算
2023-09-04 v1
摘要
无服务器计算(FaaS)因部署简便和按使用付费的优势,已被广泛用于深度学习(DL)推理。然而,现有FaaS平台以粗粒度方式利用GPU进行DL推理,未考虑时空资源复用与隔离,导致严重的GPU利用率低下、使用成本高昂以及SLO(服务水平目标)违例。亟需在无服务器计算中启用高效且SLO感知的GPU共享机制,以促进高性价比的DL推理。本文提出\textbf{FaST-GShare},一种面向FaaS的时空GPU共享(\textit{\textbf{Fa}aS-oriented \textbf{S}patio-\textbf{T}emporal \textbf{G}PU \textbf{Sharing})架构,用于深度学习推理。该架构中,我们引入FaST-Manager以限制并隔离用于GPU复用的时空资源。为实现函数性能,提出自动灵活的FaST-Profiler,在各种资源分配下对函数吞吐量进行剖析。基于剖析数据与隔离机制,我们引入具有启发式自动扩缩与高效资源分配的FaST-Scheduler以保障函数SLO。同时,FaST-Scheduler通过高效的GPU节点选择调度函数,最大化GPU使用率。此外,利用模型共享缓解内存争用。我们在OpenFaaS平台上的原型实现以及基于MLPerf的基准测试实验证明,FaST-GShare能够确保资源隔离与函数SLO。相较于时间共享机制,FaST-GShare平均可将吞吐量提升3.15倍、GPU利用率提升1.34倍、SM(流式多处理器)占用率提升3.13倍。
引用
@article{arxiv.2309.00558,
title = {FaST-GShare: Enabling Efficient Spatio-Temporal GPU Sharing in Serverless Computing for Deep Learning Inference},
author = {Jianfeng Gu and Yichao Zhu and Puxuan Wang and Mohak Chadha and Michael Gerndt},
journal= {arXiv preprint arXiv:2309.00558},
year = {2023}
}
备注
The paper has been accepted by ACM ICPP 2023