中文

面向边缘的按需无服务器推理服务的 DNN 模型高效置换方案

机器学习 2024-10-29 v1

摘要

边缘AI计算箱是一种旨在革新AI行业的计算设备。这些紧凑且稳健的硬件单元将AI处理能力直接带到数据来源——网络边缘。另一方面,按需无服务器推理服务正变得越来越流行,因为它们最小化了托管和运行DNN模型以满足中小型企业需求所需的基础设施成本。然而,这些计算设备仍受资源可用性限制。因此,服务提供商需要高效加载和卸载模型以满足日益增长的需求。本文提出FusedInf,用于在边缘端实现按需无服务器推理服务的DNN模型高效置换。FusedInf将多个模型融合为单个直接无环图(DAG),以高效加载模型到GPU内存并加快执行速度。我们的评估表明,创建单个DAG可使模型执行速度提升最高14%,同时将内存需求降低最高17%。该原型实现已公开于https://github.com/SifatTaj/FusedInf。

关键词

引用

@article{arxiv.2410.21120,
  title  = {FusedInf: Efficient Swapping of DNN Models for On-Demand Serverless Inference Services on the Edge},
  author = {Sifat Ut Taki and Arthi Padmanabhan and Spyridon Mastorakis},
  journal= {arXiv preprint arXiv:2410.21120},
  year   = {2024}
}