中文

内存高效的 De Bruijn 图构建

数据结构与算法 2012-07-17 v1 数据库

摘要

大规模并行 DNA 测序技术正在彻底改变基因组学研究。以低成本生成的数十亿条短读长(short reads)可被组装以重构完整基因组。然而,现有从头组装(de novo assembly)算法巨大的内存占用使得对哺乳动物等高等真核生物的组装极具挑战。在本文中,我们研究了构建 De Bruijn 图的内存问题,这是领先组装算法中的核心任务,对于大型基因组往往需要消耗数百 GB 内存。我们提出了一种基于磁盘的分区方法,称为最小子串分区(Minimum Substring Partitioning, MSP),旨在以小于 10 GB 的内存完成该任务,且不降低运行速度。MSP 将短读长分解为多个互不相交的小分区,以便每个分区可载入内存单独处理,随后合并形成 De Bruijn 图。通过利用 k-mer(长度为 k 的子串)之间的重叠,MSP 实现了惊人的压缩比:分区总大小从 Θ(kn)\Theta(kn) 减少到 Θ(n)\Theta(n),其中 nn 是短读长数据库的大小,kkkk-mer 的长度。实验结果表明,我们的方法可以使用商用计算机为任何大容量序列数据集构建 De Bruijn 图。

关键词

引用

@article{arxiv.1207.3532,
  title  = {Memory Efficient De Bruijn Graph Construction},
  author = {Yang Li and Pegah Kamousi and Fangqiu Han and Shengqi Yang and Xifeng Yan and Subhash Suri},
  journal= {arXiv preprint arXiv:1207.3532},
  year   = {2012}
}

备注

13 pages, 19 figures, 1 table