精确基因组组装中配对端信息的理论界限
基因组学
2013-12-30 v3
摘要
在过去的二十年中,一系列工作致力于研究基因组组装问题:从序列读段重建基因组的过程。基因组组装问题的一个早期表述表明,当将其表述为寻找包含所有观察到的读段的最短序列时,基因组重建是NP难的。尽管这一原始表述非常简化且不允许配对端信息,但后续的表述也被证明是NP难的,并且/或者可能无法保证返回正确的组装。在本文中,我们通过证明当提供足够的配对端信息时基因组组装是容易的,提供了对基因组组装问题的另一种视角。此外,我们量化了精确基因组组装所需且足够的配对端文库数量,以基因组中最长重复区域长度为指标。在我们的分析中,我们考虑了一个理想化的测序模型,其中每个配对端文库在基因组的每个位置生成具有固定且已知插入片段大小的无错误读段对。即使在这个理想化模型中,我们表明在最坏情况下无法保证精确的基因组重建,除非至少产生大约R/2L个配对端文库,其中R是基因组中最长重复区域的长度,L是每个读段的长度。另一方面,如果提供了(R/L)+1个配对端文库,则可以使用一个简单算法在多项式时间内轻松找到正确的基因组组装。尽管(R/L)+1个配对端文库在实践中可能过多,但之前的界限仅在最坏情况下成立。在我们的最后一个结果中,我们表明如果基因组满足额外条件,则仅需O(log(R/L))个配对端文库即可保证正确组装。
引用
@article{arxiv.1310.1653,
title = {Theoretical Bounds on Mate-Pair Information for Accurate Genome Assembly},
author = {Henry Lin},
journal= {arXiv preprint arXiv:1310.1653},
year = {2013}
}