中文

HyDA-Vista:迈向序列组装中 k-mer 大小的最优引导选择

计算工程、金融与科学 2014-08-26 v1

摘要

动机:组装质量与组装器构建的 de Bruijn 图的复杂性密切相关。因此,人们开发了许多范式来降低 de Bruijn 图的复杂性。其中一个明显的组合范式是允许 kk 值变化;在图更复杂的地方使用较大的 kk 值,而在图可能包含较少虚假边和顶点的地方使用较小的 kk 值。影响该方法实用性的一个开放问题是如何在构建 de Bruijn 图之前预测 kk 值。我们表明,可以通过利用系统发育相近基因组中包含的信息,在组装前预测最优 kk 值,从而使多 kk 值在基因组组装中的实际应用成为可能。结果:我们提出了 HyDA-Vista,这是一种基因组组装器,它利用同源信息在 de Bruijn 图构建之前为每条读段选择一个 kk 值。如果没有测序错误且覆盖度充足,所选的 kk 即为最优值。我们方法的核心是构建{\em 最大序列景观},这是一种数据结构,用于存储输入字符串中每个位置所包含的最大重复子串。特别地,我们展示了最大序列景观可以在 O(n+nlogn)O(n + n \log n) 时间和 O(n)O(n) 空间内构建。HyDA-Vista 首先为同源基因组构建最大序列景观。然后将读段比对到该参考基因组,并利用最大序列景观和比对结果为每条读段分配 kk 值。最终,所有读段通过迭代 de Bruijn 图构建方法进行组装。我们的结果及与其他组装器的比较表明,HyDA-Vista 在重复序列解析或支架构建之前实现了最佳的{\em E. coli}组装。

关键词

引用

@article{arxiv.1408.5592,
  title  = {HyDA-Vista: Towards Optimal Guided Selection of k-mer Size for Sequence Assembly},
  author = {Seyed Basir Shariat Razavi and Narjes Sadat Movahedi Tabrizi and Hamidreza Chitsaz and Christina Boucher},
  journal= {arXiv preprint arXiv:1408.5592},
  year   = {2014}
}

备注

11 pages, 1 figure, 1 table