InferLine:面向严苛时延目标的机器学习预测流水线配置与管理
分布式、并行与集群计算
2020-08-04 v2
摘要
服务于跨越多个模型与硬件加速器的 ML 预测流水线是生产级机器学习中的关键挑战。由于模型批大小、硬件加速器选择以及查询到达过程变化之间的相互作用,最优配置这些流水线以满足严苛的端到端时延目标十分复杂。在本文中,我们介绍 InferLine,一个配置并管理预测流水线各阶段以在满足端到端尾时延约束的同时最小化成本的系统。InferLine 由一个低频组合规划器与一个高频自动扩缩调优器组成。低频规划器利用分阶段性能剖析、离散事件仿真与约束组合搜索,自动为流水线各阶段选择硬件类型、副本数与批处理参数。高频调优器使用网络演算对各阶段自动扩缩,以应对查询到达过程变化并满足尾时延目标。我们证明,在真实工作负载下,InferLine 相较现有方法在成本上最高优出 7.6 倍,同时时延 SLO 未达标率最高降低 34.5 倍,且可泛化于最先进的模型服务框架。
引用
@article{arxiv.1812.01776,
title = {InferLine: ML Prediction Pipeline Provisioning and Management for Tight Latency Objectives},
author = {Daniel Crankshaw and Gur-Eyal Sela and Corey Zumar and Xiangxi Mo and Joseph E. Gonzalez and Ion Stoica and Alexey Tumanov},
journal= {arXiv preprint arXiv:1812.01776},
year = {2020}
}