Pagoda: 边缘加速器上DNN工作负载的能量与时间Roofline研究
分布式、并行与集群计算
2025-09-25 v1
摘要
边缘加速器(如Nvidia Jetson)正成为计算连续体的重要组成部分,常用于DNN推理和训练。Nvidia Jetson边缘设备在70W功耗范围内集成了2000多个CUDA核心,并提供1000多种功率模式以定制CPU、GPU和内存频率。其广泛变化的功耗-性能权衡可用于能源和功耗受限的部署。虽然已有数据驱动方法用于预测边缘设备上DNN工作负载的功耗和延迟,但缺乏系统性研究来理解边缘加速器及其功率模式为何表现出这样的行为。我们为Jetson Orin AGX开发了时间Roofline和一种新颖的能量Roofline模型(针对不同功率模式),并将其与DNN推理工作负载的计算(FLOP)和内存访问(字节)的分析模型相结合,从第一原理进行分析。这些模型揭示了边缘加速器上DNN工作负载的功耗与性能行为中独特且有时反直觉的洞察,例如默认功率模式MAXN并非最节能,且时间效率意味着所有功率模式下的能效。我们还将分析Roofline模型扩展到DNN训练。最后,我们应用这些方法来调整边缘设备的功率模式(从而调整Roofline),以优化DNN推理的延迟和能耗,实现最高15%的能耗降低和推理时间的最小退化。
引用
@article{arxiv.2509.20189,
title = {Pagoda: An Energy and Time Roofline Study for DNN Workloads on Edge Accelerators},
author = {Prashanthi S. K. and Kunal Kumar Sahoo and Amartya Ranjan Saikia and Pranav Gupta and Atharva Vinay Joshi and Priyanshu Pansari and Yogesh Simmhan},
journal= {arXiv preprint arXiv:2509.20189},
year = {2025}
}