中文

perf4sight:一种用于建模边缘GPU上CNN训练性能的工具流

机器学习 2021-08-13 v1 人工智能 计算机视觉与模式识别

摘要

当今边缘设备内存与处理能力的提升为更强的边缘智能创造了机会。在视觉领域,使卷积神经网络(CNN)的结构与参数适应输入数据分布,可得到具有更低内存占用、延迟和功耗的系统。然而,由于边缘设备上有限的计算资源与内存预算,系统必须能够预测训练过程的延迟与内存占用,以识别网络拓扑与设备组合中利于高效网络适应的训练配置。本工作提出perf4sight,一种自动化方法,用于开发在给定目标设备和网络下预测CNN训练内存占用与延迟的精确模型。这使得能够快速识别可在边缘设备上以低资源消耗进行重训练的网络拓扑。以PyTorch为框架、NVIDIA Jetson TX2为目标设备,所开发的模型对广泛网络的训练内存占用和延迟预测准确率分别达到95%和91%,为边缘GPU上的高效网络适应开辟了道路。

关键词

引用

@article{arxiv.2108.05580,
  title  = {perf4sight: A toolflow to model CNN training performance on Edge GPUs},
  author = {Aditya Rajagopal and Christos-Savvas Bouganis},
  journal= {arXiv preprint arXiv:2108.05580},
  year   = {2021}
}

备注

Accepted into the Workshop on Embedded and Real-World Computer Vision in Autonomous Driving (ERCVAD), ICCV 2021