中文

SWAPHI:基于 Xeon Phi 协处理器的 Smith-Waterman 蛋白质数据库搜索

分布式、并行与集群计算 2016-11-17 v2

摘要

Smith-Waterman (SW) 算法具有最高的灵敏度,使其在生物序列数据库搜索中得到广泛应用。不幸的是,高灵敏度是以二次时间复杂度为代价的,这使得该算法在处理大型数据库时计算需求极高。本文提出了 SWAPHI,这是首个利用 Xeon Phi 协处理器加速 SW 蛋白质数据库搜索的并行化算法。SWAPHI 基于“缩放与向量化”(scale-and-vectorize)方法设计,即通过有效利用众多协处理核心提供的粗粒度并行性(缩放)以及每个核心内 512 位宽的单指令多数据(SIMD)向量提供的细粒度并行性(向量化)来提升比对速度。通过在大型 UniProtKB/TrEMBL 蛋白质数据库上进行搜索,SWAPHI 在单个协处理器上实现了高达 588 亿次单元格更新每秒(GCUPS)的性能,在四个协处理器上高达 2284 亿次 GCUPS。此外,它在不同数量的协处理器上表现出良好的并行可扩展性;当使用四个协处理器时,其性能优于 16 个高端 CPU 核心上的 SWIPE 和 8 个核心上的 BLAST+,最大加速比分别为 1.52 和 1.86。SWAPHI 采用 C++ 语言编写(包含一组 SIMD 内在函数),并可于 http://swaphi.sourceforge.net 免费获取。

关键词

引用

@article{arxiv.1404.4152,
  title  = {SWAPHI: Smith-Waterman Protein Database Search on Xeon Phi Coprocessors},
  author = {Yongchao Liu and Bertil Schmidt},
  journal= {arXiv preprint arXiv:1404.4152},
  year   = {2016}
}

备注

A short version of this paper has been accepted by the IEEE ASAP 2014 conference