MLProxy:面向无服务器计算平台上机器学习推理服务的 SLA 感知反向代理
分布式、并行与集群计算
2022-02-24 v1 人工智能
机器学习
性能
摘要
在云上提供机器学习推理工作负载在生产级别上仍是一项具有挑战性的任务。由于批处理配置、资源配置与可变到达过程之间复杂的交互,为满足 SLA 要求同时优化基础设施成本而对推理工作负载进行最优配置极为复杂。无服务器计算近年来兴起,可自动化多数基础设施管理任务。工作负载批处理已展现出提升机器学习服务工作负载响应时间与成本效益的潜力。然而,无服务器计算平台尚未原生支持该能力。我们的实验表明,对于各类机器学习工作负载,批处理可通过降低每请求的处理开销来大幅提升系统效率。在本工作中,我们提出 MLProxy,一种自适应反向代理,用于在无服务器计算系统上支持高效的机器学习服务工作负载。MLProxy 支持自适应批处理,以在优化无服务器成本的同时确保 SLA 合规。我们在 Knative 上进行了严谨实验以证明 MLProxy 的有效性。我们表明,MLProxy 可将无服务器部署成本降低多达 92%,同时将 SLA 违规减少多达 99%,且可推广至最先进的模型服务框架。
引用
@article{arxiv.2202.11243,
title = {MLProxy: SLA-Aware Reverse Proxy for Machine Learning Inference Serving on Serverless Computing Platforms},
author = {Nima Mahmoudi and Hamzeh Khazaei},
journal= {arXiv preprint arXiv:2202.11243},
year = {2022}
}