中文

GenASM:面向基因组序列分析的高性能低功耗近似字符串匹配加速框架

硬件体系结构 2020-09-17 v1 基因组学

摘要

基因组序列分析已在个性化医疗、疫情追踪和进化理解等医学与科学领域实现了重大进展。遗憾的是,由于现有系统的算力和内存带宽限制,它目前成为瓶颈,因为基因组序列分析中的许多步骤必须处理大量数据。造成该瓶颈的一个主要因素是近似字符串匹配(ASM)。我们提出 GenASM,首个面向基因组序列分析的 ASM 加速框架。我们修改了底层 ASM 算法(Bitap)以显著提升其并行性并减小其内存占用,并设计了首个针对 Bitap 的硬件加速器。我们的硬件加速器由专用计算单元和片上 SRAM 组成,旨在使计算速率与内存容量和带宽相匹配。我们证明 GenASM 是一个灵活、高性能且低功耗的框架,为基因组序列分析中的三种不同用例提供了显著的性能和功耗优势:1)GenASM 加速长读长和短读长的读比对。对于长读长,GenASM 分别比最先进的软件和硬件加速器快 116 倍和 3.9 倍,同时功耗低 37 倍和 2.7 倍。对于短读长,GenASM 比最先进的软件和硬件加速器分别快 111 倍和 1.9 倍。2)GenASM 加速短读长的比对前过滤,性能为最先进比对前过滤器的 3.7 倍,同时功耗低 1.7 倍并显著提升过滤精度。3)GenASM 加速编辑距离计算,相比最先进的软件库和基于 FPGA 的加速器分别有 22-12501 倍和 9.3-400 倍的加速,同时功耗分别低 548-582 倍和 67 倍。

关键词

引用

@article{arxiv.2009.07692,
  title  = {GenASM: A High-Performance, Low-Power Approximate String Matching Acceleration Framework for Genome Sequence Analysis},
  author = {Damla Senol Cali and Gurpreet S. Kalsi and Zülal Bingöl and Can Firtina and Lavanya Subramanian and Jeremie S. Kim and Rachata Ausavarungnirun and Mohammed Alser and Juan Gomez-Luna and Amirali Boroumand and Anant Nori and Allison Scibisz and Sreenivas Subramoney and Can Alkan and Saugata Ghose and Onur Mutlu},
  journal= {arXiv preprint arXiv:2009.07692},
  year   = {2020}
}

备注

To appear in MICRO 2020