中文

面向机器学习推理的支持GPU的函数即服务

分布式、并行与集群计算 2023-03-13 v1

摘要

函数即服务(FaaS)正成为一种重要的云计算服务模型,因为它能提升广泛应用的可扩展性与易用性,尤其是需要可扩展资源与复杂软件配置的机器学习(ML)推理任务。这些推理任务高度依赖 GPU 以实现高性能;然而,现有 FaaS 方案目前缺乏对 GPU 的支持。函数特有的事件触发与短生命周期特性给在 FaaS 上启用 GPU 带来了新挑战,必须考虑 GPU 与主机内存间传输数据(如 ML 模型参数与输入/输出)的开销。本文提出一种新颖的支持 GPU 的 FaaS 方案,使 ML 推理函数能高效利用 GPU 加速计算。首先,它扩展 OpenFaaS 等现有 FaaS 框架,以支持 FaaS 集群中跨 GPU 的函数调度与执行。其次,它提供 GPU 内存中 ML 模型缓存以提升模型推理函数性能,以及 GPU 内存全局管理以提升缓存利用率。第三,它提供协同设计的 GPU 函数调度与缓存管理以优化 ML 推理函数性能。具体而言,本文提出局部性感知调度,最大化用于缓存命中的 GPU 内存与用于并行处理的 GPU 核心的利用率。基于真实轨迹与 ML 模型的充分评估表明,所提出的支持 GPU 的 FaaS 适用于 ML 推理任务,且所提出的局部性感知调度器相比默认仅负载均衡的调度器实现了 48 倍加速。

关键词

引用

@article{arxiv.2303.05601,
  title  = {GPU-enabled Function-as-a-Service for Machine Learning Inference},
  author = {Ming Zhao and Kritshekhar Jha and Sungho Hong},
  journal= {arXiv preprint arXiv:2303.05601},
  year   = {2023}
}