关于移动端推理深度神经网络时延可变性的注记
分布式、并行与集群计算
2020-03-04 v1 人工智能
机器学习
摘要
在移动设备上运行深度神经网络(DNN)推理,即移动端推理,已成为一种日益增长的趋势,使推理更少依赖网络连接并将私有数据保留在本地。先前针对移动端推理优化 DNN 的研究通常聚焦于平均推理时延这一指标,从而隐式地假设移动端推理表现出很小的时延可变性。在本注记中,我们对移动端推理 DNN 的时延可变性进行了初步测量研究。我们表明,在存在 CPU 资源竞争的情况下,推理时延可变性会变得相当显著。更有趣的是,与“某一设备上 DNN 的相对性能优势可延续至另一设备及/或另一资源竞争程度”的普遍看法不同,我们强调,当一个 DNN 模型的时延性能优于另一模型时,在资源竞争更激烈或运行于另一设备上时,该模型可能被另一模型反超。因此,在为移动端推理优化 DNN 模型时,仅测量平均时延可能并不充分;相反,应考虑各种条件下的时延可变性,包括但不限于本注记中所考虑的不同设备与不同 CPU 资源竞争程度。
引用
@article{arxiv.2003.00138,
title = {A Note on Latency Variability of Deep Neural Networks for Mobile Inference},
author = {Luting Yang and Bingqian Lu and Shaolei Ren},
journal= {arXiv preprint arXiv:2003.00138},
year = {2020}
}