MOPAR:面向无服务器平台的深度学习推理服务模型分区框架
分布式、并行与集群计算
2024-04-04 v1
摘要
随着弹性计算能力和按使用付费的成本模式,深度学习推理服务(DLIS)在无服务器平台上的部署正成为流行趋势。然而,DL模型不同层的资源需求差异大,当DLIS以单个函数部署在无服务器平台上时,会降低资源利用率并增加成本。为此,我们提出一种称为 MOPAR 的模型分区框架。该工作基于DLIS的两种资源使用模式:全球差异和局部相似性,这源于资源主导(RD)算子和层堆叠的存在。考虑到这些模式,MOPAR采用混合方法,首先将DL模型垂直划分为由相似层组成的多个切片,以提高资源效率。包含 RD 算子的切片进一步划分为多个子切片,实现并行优化以降低推理延迟。此外,MOPAR综合采用数据压缩和共享内存技术来抵消切片之间通信引入的额外时间。我们实现了MOPAR的原型系统,并在 OpenFaaS 和 AWS Lambda 上对12个DL模型的四类模型进行评估。实验结果表明,MOPAR平均可提高DLIS的资源效率达27.62%,同时将延迟降低约5.52%。基于 Lambda 的定价,MOPAR 可将运行 DLIS 的成本降低约2.58倍。
引用
@article{arxiv.2404.02445,
title = {MOPAR: A Model Partitioning Framework for Deep Learning Inference Services on Serverless Platforms},
author = {Jiaang Duan and Shiyou Qian and Dingyu Yang and Hanwen Hu and Jian Cao and Guangtao Xue},
journal= {arXiv preprint arXiv:2404.02445},
year = {2024}
}