中文

Intel Xeon Phi 集群上的并行成对相关性计算

分布式、并行与集群计算 2016-09-28 v3 基因组学

摘要

共表达网络是识别基因间相互作用的关键技术,通常依赖于跨多个样本的基因表达谱之间的全成对相关性(或类似度量)计算。Pearson 相关系数(PCC)是用于构建基因共表达网络的广泛使用的技术。然而,对于大量基因表达谱,全成对 PCC 计算对计算量要求很高,从而促使我们利用高性能计算加速其执行。在本文中,我们提出 LightPCC,首个在 Intel Xeon Phi(Phi)集群上的并行分布式全成对 PCC 计算。它通过挖掘 Phi 内部的 SIMD 指令级与线程级并行性,以及多个 Phi 之间的加速器级并行性实现高速计算。为促进均衡的工作负载分布,我们首次通过构建作业标识符与坐标空间之间的双射函数,提出了一种对称全成对计算的通用框架。我们评估了 LightPCC,并使用一组基因表达数据集将其与两个基于 CPU 的对应实现进行比较:ALGLIB 中的顺序 C++ 实现,以及基于 Intel 数学核心库(MKL)中并行通用矩阵-矩阵乘法例程的实现(均使用双精度)。性能评估显示,使用一块 5110P Phi 和 16 块 Phi 时,LightPCC 分别比 ALGLIB 快至多 20.6×20.6\times218.2×218.2\times,比单线程 MKL 快至多 6.8×6.8\times71.4×71.4\times。此外,LightPCC 在 Phi 数量方面展现出良好的并行可扩展性。LightPCC 源代码公开于 http://lightpcc.sourceforge.net。

关键词

引用

@article{arxiv.1605.01584,
  title  = {Parallel Pairwise Correlation Computation On Intel Xeon Phi Clusters},
  author = {Yongchao Liu and Tony Pan and Srinivas Aluru},
  journal= {arXiv preprint arXiv:1605.01584},
  year   = {2016}
}

备注

9 pages, 2 figures, 2 tables, accepted by the SBAC-PAD 2016 conference