TrIMS:函数即服务环境中用于低延迟深度学习推理的透明隔离模型共享
分布式、并行与集群计算
2019-11-19 v1 机器学习
摘要
深度神经网络(DNN)已成为低延迟函数即服务(FaaS)预测流水线中的核心计算组件:包括图像识别、目标检测、自然语言处理、语音合成和个性化推荐流水线。云计算作为企业与消费应用现代计算基础设施的事实骨干,必须能够处理用户定义的多样化 DNN 推理工作负载流水线,同时保持隔离与延迟保证,并最小化资源浪费。当前 FaaS 内保证隔离的方案是次优的——遭受“冷启动”延迟。造成此种低效的一个主要原因是需要在服务器内及跨服务器移动大量模型数据。我们提出 TrIMS 作为一种解决这些问题的新颖方案。我们提出的方案包含一个跨 GPU、CPU、本地存储和云存储层级的持久模型存储、一个提供隔离的高效资源管理层,以及一组简洁的应用 API 和容器技术,用于与 FaaS、深度学习(DL)框架和用户代码的轻松透明集成。我们通过将 TrIMS 与 Apache MXNet 框架对接来演示我们的方案,并展示出图像分类模型最高 24 倍延迟加速,大型模型最高 210 倍加速。我们实现了最高 8 倍系统吞吐量的提升。
引用
@article{arxiv.1811.09732,
title = {TrIMS: Transparent and Isolated Model Sharing for Low Latency Deep LearningInference in Function as a Service Environments},
author = {Abdul Dakkak and Cheng Li and Simon Garcia de Gonzalo and Jinjun Xiong and Wen-mei Hwu},
journal= {arXiv preprint arXiv:1811.09732},
year = {2019}
}
备注
In Proceedings CLOUD 2019