HiCOPS:面向基于质谱组学数据太字节级数据库搜索的高性能计算框架
分布式、并行与集群计算
2021-02-08 v2 分子网络
摘要
从质谱(MS)数据推断肽段的数据库搜索算法,一直试图提升计算效率以完成更大、更复杂的系统生物学研究。现有的串行与高性能计算(HPC)搜索引擎虽极为成功,但在理论搜索空间规模随现代非模式、多物种基于 MS 的组学分析复杂性增加而增大时,却表现出较差的可扩展性。因此,计算技术的瓶颈在于在内存或处理单元层级间移动数据的通信开销,而非算术运算。这一后摩尔时代架构变化与现代系统生物学实验需求削弱了现有 HPC 工作流的整体效能。我们提出一种新颖的高效并行计算方法及其在内存分布式架构上的实现,用于名为 HiCOPS 的肽段鉴定工具,相较多数现有 HPC 蛋白质组数据库搜索工具可实现超过 100 倍的速度提升。HiCOPS 赋予了超级计算数据库搜索概念以能力,可在合理时间框架内全面鉴定肽段及其所有修饰形式。我们通过将数 GB 实验 MS 数据在数 TB 数据库上搜索来展示:HiCOPS 使用 72 个并行节点(1728 核)在几分钟内完成肽段鉴定,而现有最先进工具使用 1 个节点(24 核)需数周;100 分钟对比 5 周;500 倍加速。最后,我们为这一避免开销的策略建立理论框架,并报告在执行时间、CPU 利用率、加速比与 I/O 效率等关键指标上的优越性能评估结果。软件将发布于:hicops.github.io
引用
@article{arxiv.2102.02286,
title = {HiCOPS: High Performance Computing Framework for Tera-Scale Database Search of Mass Spectrometry based Omics Data},
author = {Muhammad Haseeb and Fahad Saeed},
journal= {arXiv preprint arXiv:2102.02286},
year = {2021}
}
备注
Under peer review. 37 pages, 9 figures, 5 tables