中文

面向多样化异构片上系统的共享内存争用感知并发 DNN 执行

分布式、并行与集群计算 2024-02-08 v2 人工智能 性能

摘要

最先进的移动与自主系统有两个显著特征:1) 常有多个工作负载(主要是深度神经网络(DNN)推理)并发且持续运行;2) 它们运行在嵌入了为特定操作定制的异构加速器的共享内存片上系统(SoC)上。现有最先进技术缺乏必要的性能与资源管理技术,以最大化系统总吞吐量或最小化端到端工作负载延迟。在本工作中,我们提出 HaX-CoNN,一种新颖的方案,其对并发执行的 DNN 推理工作负载中的各层进行表征并映射到 SoC 内多样化的加速器集合。我们的方案独特地考虑了逐层执行特征、共享内存(SM)争用以及加速器间转换,以寻找最优调度。我们在 NVIDIA Orin、NVIDIA Xavier 和 Qualcomm Snapdragon 865 SoC 上评估了 HaX-CoNN。实验结果表明,与最先进方法相比,HaX-CoNN 最多将内存争用降低 45%,并分别最多将延迟和总吞吐量改善 32% 和 29%。

关键词

引用

@article{arxiv.2308.05869,
  title  = {Shared Memory-contention-aware Concurrent DNN Execution for Diversely Heterogeneous System-on-Chips},
  author = {Ismet Dagli and Mehmet Belviranli},
  journal= {arXiv preprint arXiv:2308.05869},
  year   = {2024}
}