Cocktail:利用集成学习优化公共云中的模型服务
分布式、并行与集群计算
2021-06-11 v1 机器学习
摘要
随着采用 ML 模型用于各种应用服务的需求不断增长,服务于这些模型的框架必须能够在公共云环境中以最小延迟提供高度准确的预测并降低部署成本。尽管存在高延迟问题,该领域先前的工作关键受限于单个模型所提供的准确率。直观上,模型集成可以通过并行智能组合不同模型来弥补准确率差距。然而,在运行时动态选择合适的模型,以最小部署成本在低延迟下满足所需准确率是一个非平凡问题。为此,我们提出 Cocktail,一个基于集成、具成本效益的模型服务框架。Cocktail 包含两个关键组件:(i) 动态模型选择框架,在满足准确率和延迟要求的同时减少集成中的模型数量;(ii) 自适应资源管理(RM)框架,采用分布式主动自动扩缩容策略结合重要性采样,为模型高效分配资源。该 RM 框架利用临时虚拟机(VM)实例来降低公共云中的部署成本。在 AWS EC2 平台上对 Cocktail 的原型实现以及使用多种工作负载的详尽评估表明,与最先进的模型服务框架相比,Cocktail 能将部署成本降低 1.45 倍,同时将延迟减少 2 倍,并满足高达 96% 请求的目标准确率。
引用
@article{arxiv.2106.05345,
title = {Cocktail: Leveraging Ensemble Learning for Optimized Model Serving in Public Cloud},
author = {Jashwant Raj Gunasekaran and Cyan Subhra Mishra and Prashanth Thinakaran and Mahmut Taylan Kandemir and Chita R. Das},
journal= {arXiv preprint arXiv:2106.05345},
year = {2021}
}
备注
Accepeted at NSDI' 2022