中文

视觉内核在 CPU、GPU 和 FPGA 实现上的能效比较

计算机视觉与模式识别 2019-07-01 v1 图像与视频处理

摘要

开发高性能嵌入式视觉应用需要在运行时性能与能耗约束之间取得平衡。鉴于嵌入式计算机视觉领域存在多种硬件加速器(如多核 CPU、GPU 和 FPGA)及其相关的供应商优化视觉库,开发者在应对这一碎片化的解决方案空间时面临挑战。为帮助确定哪种嵌入式平台最适合其应用,我们对一系列视觉内核的运行时性能和能效进行了全面的基准测试。我们基于各类视觉内核的特性,讨论了特定底层硬件架构为何固有地表现良好或较差的基本原理。具体而言,我们的研究针对三种常用的嵌入式视觉应用硬件加速器进行:ARM57 CPU、Jetson TX2 GPU 和 ZCU102 FPGA,并使用其供应商优化的视觉库:OpenCV、VisionWorks 和 xfOpenCV。结果表明,对于简单内核,GPU 相比其他平台实现了 1.1-3.2 倍的每帧能耗降低比。而对于更复杂的内核和完整的视觉流水线,FPGA 以 1.2-22.3 倍的每帧能耗降低比优于其他平台。研究还观察到,随着视觉应用流水线复杂度的增加,FPGA 的性能表现越来越好。

关键词

引用

@article{arxiv.1906.11879,
  title  = {Comparing Energy Efficiency of CPU, GPU and FPGA Implementations for Vision Kernels},
  author = {Murad Qasaimeh and Kristof Denolf and Jack Lo and Kees Vissers and Joseph Zambreno and Phillip H. Jones},
  journal= {arXiv preprint arXiv:1906.11879},
  year   = {2019}
}

备注

8 pages, Design Automation Conference (DAC), The 15th IEEE International Conference on Embedded Software and Systems, 2019