中文

CONTINUER:在边缘节点故障时维持分布式深度神经网络服务

分布式、并行与集群计算 2022-06-14 v1 机器学习

摘要

将深度神经网络(DNNs)划分并部署到边缘节点上可用于满足应用的性能目标。然而,单个节点的故障可能导致级联故障,从而对服务交付产生不利影响,并导致无法满足特定目标。这些故障的影响需要在运行时降至最低。本文探讨了三种技术,即重划分(repartitioning)、提前退出(early-exit)和跳跃连接(skip-connection)。当边缘节点发生故障时,重划分技术将对 DNN 重新划分并重新部署,从而避开故障节点。提前退出技术使请求能够在故障节点之前(提前)退出。跳跃连接技术通过跳过故障节点对请求进行动态路由。本文利用精度、端到端延迟和停机时间之间的权衡,在边缘节点故障时根据用户定义的目标(精度、延迟和停机时间阈值)选择最佳技术。为此,开发了 CONTINUER。该框架的两项关键活动是:估计使用分布式 DNN 技术时的精度和延迟,以及选择最佳技术。在基于实验室的实验测试平台上证明,CONTINUER 估计使用这些技术时的精度和延迟的平均误差分别不超过 0.28% 和 13.06%,并以不超过 16.82 毫秒的低开销和高达 99.86% 的精度选择合适的技术。

关键词

引用

@article{arxiv.2206.05267,
  title  = {CONTINUER: Maintaining Distributed DNN Services During Edge Failures},
  author = {Ayesha Abdul Majeed and Peter Kilpatrick and Ivor Spence and Blesson Varghese},
  journal= {arXiv preprint arXiv:2206.05267},
  year   = {2022}
}

备注

10 pages