在低延迟无服务器数据流上优化预测服务
分布式、并行与集群计算
2020-07-14 v1
摘要
预测服务系统旨在为机器学习模型提供大量低延迟推理。这些系统混合了数据处理与计算密集型的模型推理,并受益于多种异构处理器和分布式计算资源。在本文中,我们认为一种熟悉的数据流 API 非常适合于这一延迟敏感型任务,并且即使使用未修改的黑盒 ML 模型也易于优化。我们介绍了 Cloudflow 的设计,该系统提供此 API 并在自动伸缩的无服务器后端上实现它。Cloudflow 透明地实现了对性能至关重要的优化,包括算子融合与竞争执行。我们的评估表明,Cloudflow 的优化在合成工作负载上带来了显著的性能提升,并且在真实世界的预测流水线中比最先进的预测服务系统高出多达 2 倍,满足了实时视频分析等苛刻应用的延迟目标。
引用
@article{arxiv.2007.05832,
title = {Optimizing Prediction Serving on Low-Latency Serverless Dataflow},
author = {Vikram Sreekanti and Harikaran Subbaraj and Chenggang Wu and Joseph E. Gonzalez and Joseph M. Hellerstein},
journal= {arXiv preprint arXiv:2007.05832},
year = {2020}
}