中文

无服务器机器学习模型推理综述

分布式、并行与集群计算 2023-11-23 v1 机器学习

摘要

生成式 AI、计算机视觉与自然语言处理的近期发展导致了 AI 模型与各类产品的深度融合。AI 的广泛采用需要在生产环境中部署这些模型的巨大投入。在托管机器学习模型以进行实时预测时,满足既定的服务级别目标(SLOs)至关重要,从而确保可靠性、最小停机时间并优化底层基础设施的运营成本。大型机器学习模型常需 GPU 资源以进行高效推理来满足 SLOs。在这些趋势下,人们日益关注以无服务器架构托管 AI 模型,同时仍提供 GPU 访问以执行推理任务。本综述旨在总结并归类大规模深度学习服务系统新兴的挑战与优化机遇。通过提供一种新颖的分类法并总结近期趋势,我们希望本综述能启发新的优化视角并推动大规模深度学习服务系统中的新颖工作。

关键词

引用

@article{arxiv.2311.13587,
  title  = {A Survey of Serverless Machine Learning Model Inference},
  author = {Kamil Kojs},
  journal= {arXiv preprint arXiv:2311.13587},
  year   = {2023}
}

备注

13 pages