基于 Intel MIC 架构的浅水方程求解器集群级调优
数学软件
2014-08-11 v1 计算工程、金融与科学
分布式、并行与集群计算
计算物理
流体动力学
摘要
本文展示了在配备 Intel Xeon Phi 协处理器的集群上对混合 OpenMP+MPI 计算流体动力学代码(浅水方程求解器)执行环境的优化。讨论内容包括:(1) 控制 OpenMP 线程的数量和亲和性以优化内存带宽访问;(2) 调整 OpenMP 和 MPI 的互操作以划分问题从而获得更好的数据局部性;(3) 对 MPI 秩进行排序,将部分流量导向更快的通信通道;(4) 基于 InfiniBand 架构在 Xeon Phi 协处理器之间使用高效的点对点通信。经过调优,该应用在 2 个计算节点中的多达 8 个 Intel Xeon Phi 协处理器上实现了 90% 的并行扩展效率。对于更大的问题,由于计算与通信比率更高,可扩展性甚至更好。然而,此类规模的问题无法装入单个协处理器的内存。单个 Intel Xeon Phi 协处理器 7120P 上的求解器性能超过了双插槽 Intel Xeon E5-2697 v2 CPU 的性能,倍率为 1.6x。在每计算节点 4 个协处理器的 2 节点集群中,MIC 架构产生的性能比 CPU 高出 5.8 倍。为了在 MIC 架构上实现所报告的性能,只需更改一行遗留 Fortran 代码(不计命令行接口的更改)。本文中讨论的方法可直接应用于其他利用混合 OpenMP+MPI 方法的带宽受限模板算法。
引用
@article{arxiv.1408.1727,
title = {Cluster-level tuning of a shallow water equation solver on the Intel MIC architecture},
author = {Andrey Vladimirov and Cliff Addison},
journal= {arXiv preprint arXiv:1408.1727},
year = {2014}
}
备注
Colfax Research publication. 11 pages