中文

在简洁空间中模拟 DNA 字符串图

数据结构与算法 2019-12-02 v2

摘要

将一组测序读段转换为编码所有相关生物学信息的无损紧凑数据结构是一项重大挑战。经典方法是构建字符串图或 de Bruijn 图。根据具体应用,二者各有优势。然而,理想的设定是拥有一个易于构建且能适配任何类型生物学分析的读段索引。本文中,我们提出了一种称为 rBOSS 的新数据结构,它接近这一理想。我们的 rBOSS 在实践中是一个 de Bruijn 图,但它可模拟任意长度至 k 并能够计算节点标签间至少 m 大小的重叠,其中 k 和 m 为参数。若取参数 k 等于读段大小,则我们可模拟完整的字符串图。与大多数基于 BWT 的结构一样,rBOSS 是单向的,但它利用 DNA 反向互补的性质以一定的时空权衡来模拟双向性。我们在 rBOSS 之上实现了一个基因组组装器以展示其效用。实验结果表明,使用 k = 100 时,rBOSS 可在不到 15 分钟内组装 185 MB 的读段,总共占用 110 MB。它产生的重叠群平均大小超过 10,000,是使用定长 k 的纯 de Bruijn 图所得大小的两倍。

关键词

引用

@article{arxiv.1901.10453,
  title  = {Simulating the DNA String Graph in Succinct Space},
  author = {Diego Díaz-Domínguez and Travis Gagie and Gonzalo Navarro},
  journal= {arXiv preprint arXiv:1901.10453},
  year   = {2019}
}

备注

This research has received funding from the European Union's Horizon 2020 research and innovation programme under the Marie Sklodowska-Curie Actions H2020-MSCA-RISE-2015 BIRDS GA No. 690941