中文

以最小内存占用实现实时DNN推理的需求分层法

机器学习 2022-10-11 v1

摘要

在执行深度神经网络(DNN)时,其模型参数在执行前被载入GPU内存,造成显著的GPU内存负担。已有研究通过利用CPU内存作为交换设备来减少GPU内存占用。然而,该方法不适用于大多数采用集成GPU、CPU与GPU共享通用内存的嵌入式系统。对此,我们提出需求分层(Demand Layering),其将快速固态硬盘(SSD)作为GPU的协同运行伙伴,并利用DNN逐层执行的特点。在我们的方法中,DNN以逐层方式加载并执行,将内存占用最小化至单层量级。此外,我们开发了流水线架构,隐藏了由参数加载与层执行交错所引起的大部分额外延迟。我们的实现在代表性DNN上平均实现了96.5%的内存缩减,仅带来14.8%的延迟开销。进一步,通过利用内存-延迟权衡,可在内存占用略增(仍减少88.4%)的情况下实现近零延迟开销(低于1 ms),展示了需求分层的巨大潜力。

关键词

引用

@article{arxiv.2210.04024,
  title  = {Demand Layering for Real-Time DNN Inference with Minimized Memory Usage},
  author = {Mingoo Ji and Saehanseul Yi and Changjin Koo and Sol Ahn and Dongjoo Seo and Nikil Dutt and Jong-Chan Kim},
  journal= {arXiv preprint arXiv:2210.04024},
  year   = {2022}
}

备注

14 pages, 16 figures. Accepted to the 43rd IEEE Real-Time Systems Symposium (RTSS), 2022