中文

面向基因组学应用的并行加速向量相似度计算

分布式、并行与集群计算 2018-04-23 v3 数据结构与算法 性能

摘要

基因组数据可用性的激增为确定所观察到的个体性状的遗传原因带来了希望,可应用于发现表型的遗传根源等问题,无论是基因表达或代谢物浓度等分子表型,还是疾病等复杂表型。然而,这些数据集不断增长的规模以及相关算法的二次、三次或更高阶的扩展特性构成了严重的计算挑战,需要使用领导级计算。在本文中,我们描述了一种执行向量相似度度量计算的新方法,适用于配备图形处理单元(GPU)或 Intel Xeon Phi 处理器的并行系统。我们的主要关注点是应用于全基因组关联研究(GWAS)和全表型组关联研究(PheWAS)的比例相似度度量。我们描述了在加速处理器上实现算法的方法、用于消除由对称性引起的冗余计算的方法,以及将计算高效映射到多节点并行系统的技术。给出的结果展示了高单节点性能和并行可扩展性,在 ORNL Titan 系统上每秒实现了超过五千万亿次元素级比较。在配套论文中,我们描述了应用于比较基因组学应用的自定义相关系数计算的相应技术。

关键词

引用

@article{arxiv.1705.08210,
  title  = {Parallel Accelerated Vector Similarity Calculations for Genomics Applications},
  author = {Wayne Joubert and James Nance and Deborah Weighill and Daniel Jacobson},
  journal= {arXiv preprint arXiv:1705.08210},
  year   = {2018}
}