SparseAssembler:基于稀疏 de Bruijn 图的从头组装
数据结构与算法
2011-07-11 v1 基因组学
摘要
基于 de Bruijn 图的算法是 de novo 基因组组装中两种最广泛使用的方法之一。该方法的一个主要限制是构建 de Bruijn 图需要巨大的计算内存空间,该空间随 k-mer 长度和基因组中独特 k-mer 的总多样性(N)(以碱基对表示)缩放,大致为 (2k+8)N 比特。这一限制在大规模基因组分析以及同时处理多个基因组的测序中心尤为重要。我们提出了一种稀疏 de Bruijn 图结构,并基于此开发了 SparseAssembler,它极大地降低了内存空间需求。该结构还使我们能够引入一种新方法来去除测序过程中引入的替换错误。稀疏 de Bruijn 图结构跳过 g 个中间 k-mer,因此将理论内存空间需求降低至约 (2k/g+8)N。我们发现 g=16 的实际取值消耗的内存约为标准 de Bruijn 图算法所需内存的 10%,但产生了可比的结果。高错误率可能会使 SparseAssembler 失效。因此,我们开发了一种基于稀疏 de Bruijn 图的去噪算法,该算法可以从错误率 ≤ 2% 的数据集中去除超过 99% 的替换错误。鉴于当前一代测序仪的替换错误率低于 1%,我们的去噪程序足以有效保障我们算法的性能。最后,我们还为稀疏 de Bruijn 图结构引入了一种新颖的类 Dijkstra 广度优先搜索算法,以规避残余错误并解析多态性。
引用
@article{arxiv.1106.2603,
title = {SparseAssembler: de novo Assembly with the Sparse de Bruijn Graph},
author = {Chengxi Ye and Zhanshan Sam Ma and Charles H. Cannon and Mihai Pop and Douglas W. Yu},
journal= {arXiv preprint arXiv:1106.2603},
year = {2011}
}
备注
Corresponding author: Douglas W. Yu, [email protected]