基因组组装中段重复序列的快速表征
数据结构与算法
2018-09-25 v2 基因组学
摘要
段重复序列(SDs),或称低拷贝重复(LCR),是长度大于1 Kbp且序列一致性高的DNA片段,被复制到基因组的其他区域。SDs是最重要的进化来源之一,是基因组结构变异的常见原因,且其中若干与基因组源性疾病相关。尽管具有功能重要性,SDs仍是de novo基因组组装的主要障碍之一,因为它们在构建和遍历当前最先进的overlap-layout-consensus与de Bruijn图时造成了歧义。这导致SD区域被错误组装、折叠为单一表示,或完全缺失于各种生物的已组装参考基因组中。反过来,这些缺失或错误信息限制了我们充分理解基因组进化与结构的能力。尽管迫切需要准确表征组装中的SDs,目前为此目的开发的工具仅有一个,称为全基因组组装比较(WGAC)。WGAC由若干步骤组成,使用了不同工具和自定义脚本,使其难以使用且耗时。因此仍需要能够快速、准确且用户友好地表征组装内SDs的算法。在此我们引入段重复评估框架(SEDEF),通过基于Jaccard相似度和局部链结的复杂过滤策略快速检测SDs。我们表明SEDEF能准确检测SDs,同时相比WGAC大幅加速,实际运行时间从数周缩短至数分钟。值得注意的是,我们的算法可捕获片段间高达25%的成对误差,而先前研究仅关注10%,使我们能更深入地追踪基因组的进化历史。SEDEF可在 https://github.com/vpc-ccg/sedef 获取。
引用
@article{arxiv.1807.00205,
title = {Fast Characterization of Segmental Duplications in Genome Assemblies},
author = {Ibrahim Numanagić and Alim S. Gökkaya and Lillian Zhang and Bonnie Berger and Can Alkan and Faraz Hach},
journal= {arXiv preprint arXiv:1807.00205},
year = {2018}
}