中文

DBG2OLC:利用第三代测序技术长错误读段高效组装大型基因组

基因组学 2016-09-06 v4

摘要

(本手稿的更新版本已于 2016 年被 Scientific Reports 接收,请参阅 http://www.nature.com/articles/srep31900)从下一代测序(NGS)到第三代测序(3GS)的备受期待的过渡一直困难重重,主要原因是高错误率和过高的测序成本。高错误率使得大型基因组的长错误读段组装极具挑战性,因为现有软件解决方案往往被纠错任务所淹没。本文报道了一种同时利用 NGS 和 3GS 数据的混合组装方法,以解决这两个问题。我们从三个通用且基本的设计原则中获益:(i)长读段的紧凑表示可实现高效比对。(ii)碱基级错误可被跳过;结构错误需要被检测并纠正。(iii)结构正确的 3GS 读段被组装并抛光。在我们的实现中,预组装的 NGS 重叠群被用于推导长读段的紧凑表示,从而建立了从 de Bruijn 图到重叠图的算法转换,这是两种主要的组装范式。此外,由于 NGS 和 3GS 数据可以相互补偿,我们的混合组装方法降低了对两者的测序要求。实验表明,我们的软件能够以比现有方法快数个数量级的时间效率组装哺乳动物大小的基因组,同时节省约一半的测序成本。

关键词

引用

@article{arxiv.1410.2801,
  title  = {DBG2OLC: Efficient Assembly of Large Genomes Using Long Erroneous Reads of the Third Generation Sequencing Technologies},
  author = {Chengxi Ye and Chris Hill and Shigang Wu and Jue Ruan and Zhanshan and Ma},
  journal= {arXiv preprint arXiv:1410.2801},
  year   = {2016}
}