中文

在能耗受限的 CPU 上对深度学习卷积进行基准测试

人工智能 2026-01-06 v2 硬件体系结构

摘要

这项工作评估了用于基于 CPU 的 CNN 推理的最先进卷积算法。尽管大多数先前的研究集中在 GPU 或 NPU 上,但 CPU 实现仍然相对未充分优化。我们的第一个贡献是提供嵌入式 CPU 推理的公平基准测试。我们评估了来自 ARM、Intel、AMD 和 NVIDIA 供应商的现代 CPU 上的直接卷积、基于 GEMM 的卷积和 Winograd 卷积,同时考虑了延迟和能效。据我们所知,这是第一项使用高分辨率插槽级测量平台呈现跨供应商 CPU 能耗公平比较的研究。为了验证我们的方法,我们进一步将插槽级功率测量与从特定模型寄存器(MSR)得出的估计值进行了比较,发现 MSR 低估了卷积推理的功耗 10-30%。我们的结果表明,ARM Cortex-A78AE CPU 结合隐式 GEMM 卷积实现在延迟和功耗之间提供了最佳折衷,以 25.3 W 的平均功率在 102 ms 内实现了 ResNet50v1.5 推理,对应于 2.58 J。

关键词

引用

@article{arxiv.2509.26217,
  title  = {Benchmarking Deep Learning Convolutions on Energy-constrained CPUs},
  author = {Enrique Galvez and Adrien Cassagne and Alix Munier and Manuel Bouyer},
  journal= {arXiv preprint arXiv:2509.26217},
  year   = {2026}
}