在分布式边缘设备上划分与放置深度神经网络以最大化推理吞吐量
网络与互联网体系结构
2022-10-25 v1
摘要
边缘推理已变得更加广泛,其多样化应用从零售延伸到可穿戴技术。由联网的资源受限边缘设备组成的集群正变得常见,然而尚无系统能够在跨这些集群切分 DNN 的同时最大化系统的推理吞吐量。我们提出一种算法,该算法对 DNN 进行划分并将其分布到一组边缘设备上,目标是最小化瓶颈延迟从而最大化推理吞吐量。该系统可良好地扩展到具有不同节点内存容量和节点数量的系统。我们发现,相较于随机算法,该算法可将瓶颈延迟降低 10 倍,相较于贪心联合划分-放置算法可降低 35%。此外,我们通过实证发现,对于我们测试的代表性模型集合,该算法产生的结果与最优瓶颈延迟的差距在 9.2% 以内。
引用
@article{arxiv.2210.12219,
title = {Partitioning and Placement of Deep Neural Networks on Distributed Edge Devices to Maximize Inference Throughput},
author = {Arjun Parthasarathy and Bhaskar Krishnamachari},
journal= {arXiv preprint arXiv:2210.12219},
year = {2022}
}
备注
Accepted to the International Telecommunication Networks and Applications Conference 2022 (ITNAC 2022)