中文

AnySeq:基于部分求值的高性能序列比对库

分布式、并行与集群计算 2022-05-17 v1 性能

摘要

序列比对是生物信息学的基础,由此产生了多种优化实现。遗憾的是,其中绝大多数都是针对特定架构和执行模型手工调优的。这不仅使它们难以理解和扩展,也难以移植到其他平台。我们提出 AnySeq——一个用于计算 DNA 序列不同类型两两比对的新型库。我们的方法通过部分求值的概念,将高性能与直观易懂的实现相结合。利用 AnyDSL 编译器框架,AnySeq 能够用单一、统一的代码库编译出针对特定使用场景和硬件目标高度优化的算法变体。由此产生的领域特定库允许通过简单的函数组合而非通常难以理解的元编程技术来改变比对参数(如比对类型、打分方案和回溯与纯打分)。我们的实现支持 CPU 上的多线程和 SIMD 向量化、CUDA 支持的 GPU 以及 FPGA。在 CPU(SeqAn)和 GPU(NVBio)上,AnySeq 至多比最先进的手动优化比对库慢 7%,且在许多情况下更快(最高达 12%)。

关键词

引用

@article{arxiv.2002.04561,
  title  = {AnySeq: A High Performance Sequence Alignment Library based on Partial Evaluation},
  author = {André Müller and Bertil Schmidt and Andreas Hildebrandt and Richard Membarth and Roland Leißa and Matthis Kruse and Sebastian Hack},
  journal= {arXiv preprint arXiv:2002.04561},
  year   = {2022}
}

备注

To be published in IPDPS 2020. This work is supported by the Federal Ministry of Education and Research (BMBF) as part of the MetaDL, Metacca, and ProThOS projects as well as by the Intel Visual Computing Institute (IVCI) and Cluster of Excellence on Multimodal Computing and Interaction (MMCI) at Saarland University