一式难合众需:通过容忍度层级量化并揭示机器学习云服务API的准确率-延迟权衡
机器学习
2019-06-28 v1 计算机视觉与模式识别
性能
摘要
当今的云服务架构遵循“一式合众需”的部署策略,即向终端用户提供相同的服务版本实例。然而,用户群体广泛,不同应用对准确率和响应速度的要求各异,正如我们所展示的,这使得“一式合众需”的方法在实践中效率低下。我们使用一个服务于数千用户的生产级语音识别引擎和一个开源的计算机视觉系统来阐述我们的观点。为克服“一式合众需”方法的局限性,我们推荐采用容忍度层级(Tolerance Tiers),其中每个MLaaS层级展现一种准确率/响应速度特性,用户可编程地选择层级。我们在基于CPU的自动语音识别(ASR)引擎以及部署于CPU和GPU上的前沿图像分类神经网络上评估了我们的提议。结果表明,我们提出的方法提供了一种可由终端API用户或消费者调优的MLaaS云服务架构,其性能优于传统的“一式合众需”方法。
引用
@article{arxiv.1906.11307,
title = {One Size Does Not Fit All: Quantifying and Exposing the Accuracy-Latency Trade-off in Machine Learning Cloud Service APIs via Tolerance Tiers},
author = {Matthew Halpern and Behzad Boroujerdian and Todd Mummert and Evelyn Duesterwald and Vijay Janapa Reddi},
journal= {arXiv preprint arXiv:1906.11307},
year = {2019}
}
备注
2019 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)