中文

多核CPU上内存受限循环核函数重叠执行的分析性能模型

分布式、并行与集群计算 2020-11-03 v1 性能

摘要

运行在多核处理器上的复杂应用呈现出丰富的性能现象。每个ccNUMA域中核心数量的不断增长使得内存受限代码的性能分析变得复杂,因为系统噪声、负载不平衡或基于任务的编程模型可能导致线程去同步。因此,所有核心执行同一循环的简化假设不再成立。受HPCG基准测试原版及修改版观测结果的启发,我们构建了内存受限循环核函数执行的一个性能模型。该模型可根据内存争用域上活跃核心的数量以及核函数与何种其他工作负载配对,预测每个核函数在内存带宽上的占用份额。所需的唯一代码特征是每个核函数的单线程缓存行访问频率(与单线程内存带宽直接相关)及其饱和带宽。该频率可直接测量或使用执行-缓存-内存(ECM)性能模型预测。核函数的计算强度及代码的详细结构无关紧要。我们在Intel Broadwell、Intel Cascade Lake和AMD Rome处理器上通过将多种流式与模板核函数配对验证了模型,预测每核函数带宽份额的误差小于8%。

关键词

引用

@article{arxiv.2011.00243,
  title  = {An analytic performance model for overlapping execution of memory-bound loop kernels on multicore CPUs},
  author = {Ayesha Afzal and Georg Hager and Gerhard Wellein},
  journal= {arXiv preprint arXiv:2011.00243},
  year   = {2020}
}

备注

10 pages, 9 figures