中文

通过改善内存访问将关键生物信息学任务加速百倍

分布式、并行与集群计算 2021-07-21 v1 基因组学

摘要

大多数实验科学如今都依赖计算,生物科学也不例外。随着数据集变大,计算成本也随之增加,使得对科学家所用代码进行恰当优化愈发重要。近年来开发的许多代码基于 Python 的 NumPy,因其易用性和良好的性能特征。然而,NumPy 的可组合特性通常与现代 CPU 的多级架构不相适应,使得任何非平凡的多步算法受限于外部内存访问速度,而后者比 CPU 的计算能力慢数百倍。为充分利用 CPU 计算能力,必须将工作内存占用保持足够小以适配 CPU 缓存,这需要将问题拆分为更小的部分并尽可能多地融合步骤。在本文中,我们基于这些原则对 scikit-bio 库中的两个重要函数——主坐标分析和 Mantel 检验——进行了改进,使这些广泛使用的通用工具获得了超过 100 倍的加速。

关键词

引用

@article{arxiv.2104.09565,
  title  = {Accelerating key bioinformatics tasks 100-fold by improving memory access},
  author = {Igor Sfiligoi and Daniel McDonald and Rob Knight},
  journal= {arXiv preprint arXiv:2104.09565},
  year   = {2021}
}

备注

6 pages, 3 tables, 7 algorithms, To be published in Proceedings of PEARC21