Genome-on-Diet:通过稀疏化基因组学驯服大规模基因组分析
数据结构与算法
2024-07-11 v3 基因组学
定量方法
摘要
搜索相似基因组序列是生物医学研究及绝大多数基因组分析中必不可少的基础步骤。执行此类比较的最先进计算方法无法应对基因组测序数据的指数级增长。我们引入稀疏化基因组学(sparsified genomics)的概念,系统性地从基因组序列中排除大量碱基,从而实现对稀疏化后的更短基因组序列更快且更省内存的处理,同时相较于处理非稀疏化序列提供相似甚至更高的准确率。稀疏化基因组学为许多基因组分析带来显著益处且具有广泛适用性。我们展示,使用真实 Illumina、HiFi 和 ONT 读段时,稀疏化基因组序列使最先进的读段比对工具(minimap2)分别加速 2.57-5.38倍、1.13-2.78倍和 3.52-6.28倍,同时相较 minimap2 提供最高 2.1倍更小的内存占用、2倍更小的索引大小,以及更多真实检出的小变异与结构变异。稀疏化基因组序列使通过极大基因组和大型数据库的包含搜索(containment search)比通过非稀疏化基因组序列搜索(使用 CMash 和 KMC3)快 72.7-75.88倍且存储效率高 723.3倍。稀疏化基因组序列通过提供比最先进工具(Metalign)快 54.15-61.88倍且存储效率高 720倍的宏基因组样本分类学分析,实现了稳健的微生物组发现。我们设计并开源了一个名为 Genome-on-Diet 的框架作为稀疏化基因组学的示例工具,可从 https://github.com/CMU-SAFARI/Genome-on-Diet 免费下载。
引用
@article{arxiv.2211.08157,
title = {Genome-on-Diet: Taming Large-Scale Genomic Analyses via Sparsified Genomics},
author = {Mohammed Alser and Julien Eudine and Onur Mutlu},
journal= {arXiv preprint arXiv:2211.08157},
year = {2024}
}