基于 de Bruijn 图的读段映射
数据结构与算法
2018-02-14 v4 基因组学
摘要
背景 下一代测序(NGS)极大地提升了我们测序基因组的能力,却未提升组装能力。实际上,许多已发布的基因组序列仍停留在大量 contigs(重叠群)的状态。每个 contig 描述了在组装图的某条路径上发现的序列,然而 contig 集合并未记录该图所含的全部序列信息。尽管许多后续分析可利用 contig 集合进行,但人们可能质疑在 contigs 上映射读段是否如同在组装图路径上映射那般信息丰富。当前缺乏在此类图上执行映射的实用工具。结果 在此,我们提出 de Bruijn 图上映射的形式化定义,分析问题复杂度(其为 NP-complete),并给出实用解决方案。我们提出称为 GGMAP(贪心图映射)的流程。其新颖之处在于将读段映射到图的分支路径上的过程,为此我们设计了称为 BGREAT(de Bruijn 图读段映射工具)的启发式算法。为效率起见,BGREAT 将读段序列重写为一系列 unitigs(单位重叠群)序列。GGMAP 可在基于大量人类基因组读段构建的 de Bruijn 图上每 CPU 小时映射数百万读段。令人惊讶的是,结果显示多达 22% 更多读段可映射到图上而非 contig 集合。结论 尽管在 de Bruijn 图上映射读段是复杂任务,我们的方案提供了实用解决途径,兼具效率与相比基于组装的映射有所提升的映射能力,即便对复杂真核数据亦然。可用性:github.com/Malfoy/BGREAT
引用
@article{arxiv.1505.04911,
title = {Read Mapping on de Bruijn graph},
author = {Antoine Limasset and Bastien Cazaux and Eric Rivals and Pierre Peterlongo},
journal= {arXiv preprint arXiv:1505.04911},
year = {2018}
}
备注
BMC Bioinformatics