SWAPHI:基于 Xeon Phi 协处理器的 Smith-Waterman 蛋白质数据库搜索
分布式、并行与集群计算
2016-11-17 v2
摘要
Smith-Waterman (SW) 算法具有最高的灵敏度,使其在生物序列数据库搜索中得到广泛应用。不幸的是,高灵敏度是以二次时间复杂度为代价的,这使得该算法在处理大型数据库时计算需求极高。本文提出了 SWAPHI,这是首个利用 Xeon Phi 协处理器加速 SW 蛋白质数据库搜索的并行化算法。SWAPHI 基于“缩放与向量化”(scale-and-vectorize)方法设计,即通过有效利用众多协处理核心提供的粗粒度并行性(缩放)以及每个核心内 512 位宽的单指令多数据(SIMD)向量提供的细粒度并行性(向量化)来提升比对速度。通过在大型 UniProtKB/TrEMBL 蛋白质数据库上进行搜索,SWAPHI 在单个协处理器上实现了高达 588 亿次单元格更新每秒(GCUPS)的性能,在四个协处理器上高达 2284 亿次 GCUPS。此外,它在不同数量的协处理器上表现出良好的并行可扩展性;当使用四个协处理器时,其性能优于 16 个高端 CPU 核心上的 SWIPE 和 8 个核心上的 BLAST+,最大加速比分别为 1.52 和 1.86。SWAPHI 采用 C++ 语言编写(包含一组 SIMD 内在函数),并可于 http://swaphi.sourceforge.net 免费获取。
引用
@article{arxiv.1404.4152,
title = {SWAPHI: Smith-Waterman Protein Database Search on Xeon Phi Coprocessors},
author = {Yongchao Liu and Bertil Schmidt},
journal= {arXiv preprint arXiv:1404.4152},
year = {2016}
}
备注
A short version of this paper has been accepted by the IEEE ASAP 2014 conference