理解 Intel Broadwell 与 Cascade Lake 处理器上的 HPC 基准性能
性能
2020-06-25 v2 分布式、并行与集群计算
摘要
高性能计算中的硬件平台正变得日益复杂,即便仅考虑多核 CPU 也是如此。硬件与软件环境中众多与性能相关的特性和配置选项,大多数应用用户或开发者甚至并不知晓。微基准测试(即探究硬件某一特定方面的简单代码)有助于阐明此类问题,但前提是其被充分理解且结果能与已知事实或性能模型相吻合。从微基准测试获得的洞见随后可应用于真实应用以进行性能分析或优化。本文深入研究了两种现代 Intel x86 服务器 CPU 架构:Broadwell EP 与 Cascade Lake SP。我们强调了可能对代码性能产生决定性影响的相关硬件配置设置,并展示了如何准确测量片上与片外数据传输带宽。Cascade Lake 的新型 victim L3 缓存及其先进替换策略得到了应有的关注。最后,我们使用 DGEMM、稀疏矩阵-向量乘法以及 HPCG 基准测试,将结果与相关应用场景建立联系。
引用
@article{arxiv.2002.03344,
title = {Understanding HPC Benchmark Performance on Intel Broadwell and Cascade Lake Processors},
author = {Christie L. Alappat and Johannes Hofmann and Georg Hager and Holger Fehske and Alan R. Bishop and Gerhard Wellein},
journal= {arXiv preprint arXiv:2002.03344},
year = {2020}
}
备注
19 pages, 9 figures, 3 tables. Corrected affiliations and acknowledgments