面向多核系统的高效架构感知型 BWA-MEM 加速
分布式、并行与集群计算
2019-07-31 v1 计算工程、金融与科学
性能
基因组学
摘要
下一代测序技术的创新使得 DNA 序列数据的生成速度越来越快且成本极低。大型测序中心通常部署数百套此类系统。这种高吞吐量和低成本的数据生成凸显了对测序数据下游计算分析进行相应加速的需求。下游分析中的一个基本步骤是将读段映射到较长的参考 DNA 序列(例如参考人类基因组)。序列映射是一个计算密集型步骤,占 GATK 工作流程总时间的 30% 以上。BWA-MEM 是应用最广泛的序列映射工具之一,拥有数万用户。本工作中,我们专注于通过高效的架构感知型实现来加速 BWA-MEM,同时保持输出完全一致。数据量要求分布式计算环境,通常部署多核处理器。由于该应用可易于针对分布式内存系统并行化,我们专注于在单插槽多核处理器上的性能提升。BWA-MEM 的运行时间由三个核心内核主导,它们合计占总体计算时间的 85% 以上。我们通过以下方式提升了这些内核的性能:1) 改善缓存复用,2) 简化算法,3) 将零散的小内存分配替换为少量大块连续内存,4) 软件预取,以及 5) 在适用处利用 SIMD——并对源代码进行大规模重组以实现这些改进。结果,我们在三个内核上分别实现了近 2 倍、183 倍和 8 倍的加速,在 Intel Xeon Skylake 处理器的单线程和单插槽上,端到端计算时间相较原始 BWA-MEM 分别实现了最高 3.5 倍和 2.4 倍的加速。据我们所知,这是已报道的相对于 BWA-MEM 的最高加速比。
引用
@article{arxiv.1907.12931,
title = {Efficient Architecture-Aware Acceleration of BWA-MEM for Multicore Systems},
author = {Vasimuddin Md and Sanchit Misra and Heng Li and Srinivas Aluru},
journal= {arXiv preprint arXiv:1907.12931},
year = {2019}
}