中文

GenPIP:通过碱基识别与读段映射的紧密集成实现基因组分析的内存计算加速

硬件体系结构 2023-12-19 v2 数据结构与算法 基因组学

摘要

纳米孔测序是一种广泛使用的高通量基因组测序技术,能够以低成本将基因组的长片段测序为原始电信号。纳米孔测序需要两个计算代价高昂的处理步骤以实现准确的下游基因组分析。第一步,碱基识别,将原始电信号翻译为核苷酸碱基(即 A、C、G、T)。第二步,读段映射,在参考基因组中找到读段的正确位置。在现有基因组分析流程中,碱基识别与读段映射是分开执行的。我们在本工作中观察到,这两个最耗时步骤的分离执行本质上导致了(1)显著的数据搬移和(2)对数据的冗余计算,拖慢了基因组分析流程。本文提出 GenPIP,一种将碱基识别与读段映射紧密集成的存内基因组分析加速器。GenPIP 通过两个关键机制提升基因组分析流程性能:(1)主要基因组分析步骤在内存中的细粒度并行协同执行;(2)一种用于低质量及未映射读段早期拒绝的新技术,以及时停止此类读段的基因组分析执行,减少低效计算。我们的实验表明,在基因组分析流程执行中,与在最先进 CPU(GPU)上执行的最先进软件基因组分析工具相比,GenPIP 提供 41.6X(8.4X)加速和 32.8X(20.8X)能耗节省,且精度损失可忽略。与结合最先进存内碱基识别和读段映射加速器的设计相比,GenPIP 提供 1.39X 加速和 1.37X 能耗节省。

关键词

引用

@article{arxiv.2209.08600,
  title  = {GenPIP: In-Memory Acceleration of Genome Analysis via Tight Integration of Basecalling and Read Mapping},
  author = {Haiyu Mao and Mohammed Alser and Mohammad Sadrosadati and Can Firtina and Akanksha Baranwal and Damla Senol Cali and Aditya Manglik and Nour Almadhoun Alserr and Onur Mutlu},
  journal= {arXiv preprint arXiv:2209.08600},
  year   = {2023}
}

备注

17 pages, 13 figures