在 TB 级数据上实现 PFLOPS 计算:全基因组关联研究的案例
数学软件
2013-05-01 v1 计算工程、金融与科学
性能
基因组学
定量方法
摘要
在许多科学和工程应用中,人们必须解决的并非单个问题实例,而是一系列相同问题的实例。通常,序列中的问题以某种方式相互关联,从而允许重用中间结果。全基因组关联研究(Genome-Wide Association Studies, GWAS)是此类应用的一个典型例子,它是计算生物学中广泛使用的工具。GWAS 需要求解多达万亿()个相关的广义最小二乘问题,构成了严峻挑战:即在 TB 级数据上实现 PFLOPS( 次浮点运算)的性能。在本文中,我们设计了一种在多核架构上执行 GWAS 的算法。这通过三个步骤完成。首先,我们展示了如何利用连续问题之间的关系,从而降低整体计算复杂度。其次,通过对所需数据传输的分析,我们确定了如何消除由输入/输出操作引起的任何开销。最后,我们研究了如何将计算分解为任务并分配给可用核心,以实现高性能和可扩展性。使用我们的算法,目前需要使用超级计算机进行的 GWAS 现在可以在单个多核节点上数小时内完成。讨论围绕开发该算法的方法论而非具体应用展开。我们相信,本文为计算科学家如何开发和优化数值算法提供了具有普遍适用价值的指导方针。
引用
@article{arxiv.1210.7683,
title = {Computing Petaflops over Terabytes of Data: The Case of Genome-Wide Association Studies},
author = {Diego Fabregat-Traver and Paolo Bientinesi},
journal= {arXiv preprint arXiv:1210.7683},
year = {2013}
}