有限差分算法在多核 CPU、GPU 与 Intel Xeon Phi 处理器上的能效
数学软件
2017-09-29 v1 性能
计算物理
流体动力学
摘要
除了高性能计算系统中常见的硬件运行时间限制外,未来的系统很可能还会受到能耗预算的约束。在本文中,我们在 Intel Ivy Bridge CPU 节点、Intel Xeon Phi Knights Landing 处理器和 NVIDIA Tesla K40c GPU 上,从能效和运行时间两方面评估了具有不同计算与访存强度的有限差分算法。我们发现,将离散导数存储到全局数组以推进求解的传统方法在能耗和运行时间方面效率低下。相比之下,一类将离散导数即时计算或存储为线程/进程局部变量(从而产生高计算强度)的算法在能耗和运行时间上均是最优的。在所考虑的所有三种硬件架构上,与访存密集型算法相比,高计算密集型算法实现了约 2 倍的加速和约 2 倍的节能。研究发现,无论功耗如何,能耗与运行时间成正比,并且 GPU 相比于相同算法在 CPU 节点上的运行实现了约 5 倍的节能。
引用
@article{arxiv.1709.09713,
title = {Energy efficiency of finite difference algorithms on multicore CPUs, GPUs, and Intel Xeon Phi processors},
author = {Satya P. Jammy and Christian T. Jacobs and David J. Lusher and Neil D. Sandham},
journal= {arXiv preprint arXiv:1709.09713},
year = {2017}
}
备注
Submitted to Computers and Fluids