HyDA-Vista:迈向序列组装中 k-mer 大小的最优引导选择
计算工程、金融与科学
2014-08-26 v1
摘要
动机:组装质量与组装器构建的 de Bruijn 图的复杂性密切相关。因此,人们开发了许多范式来降低 de Bruijn 图的复杂性。其中一个明显的组合范式是允许 值变化;在图更复杂的地方使用较大的 值,而在图可能包含较少虚假边和顶点的地方使用较小的 值。影响该方法实用性的一个开放问题是如何在构建 de Bruijn 图之前预测 值。我们表明,可以通过利用系统发育相近基因组中包含的信息,在组装前预测最优 值,从而使多 值在基因组组装中的实际应用成为可能。结果:我们提出了 HyDA-Vista,这是一种基因组组装器,它利用同源信息在 de Bruijn 图构建之前为每条读段选择一个 值。如果没有测序错误且覆盖度充足,所选的 即为最优值。我们方法的核心是构建{\em 最大序列景观},这是一种数据结构,用于存储输入字符串中每个位置所包含的最大重复子串。特别地,我们展示了最大序列景观可以在 时间和 空间内构建。HyDA-Vista 首先为同源基因组构建最大序列景观。然后将读段比对到该参考基因组,并利用最大序列景观和比对结果为每条读段分配 值。最终,所有读段通过迭代 de Bruijn 图构建方法进行组装。我们的结果及与其他组装器的比较表明,HyDA-Vista 在重复序列解析或支架构建之前实现了最佳的{\em E. coli}组装。
引用
@article{arxiv.1408.5592,
title = {HyDA-Vista: Towards Optimal Guided Selection of k-mer Size for Sequence Assembly},
author = {Seyed Basir Shariat Razavi and Narjes Sadat Movahedi Tabrizi and Hamidreza Chitsaz and Christina Boucher},
journal= {arXiv preprint arXiv:1408.5592},
year = {2014}
}
备注
11 pages, 1 figure, 1 table