计算自然基因组的重排距离
数据结构与算法
2021-08-11 v4
摘要
基因组距离的计算在过去 25 年中一直是计算比较基因组学中非常活跃的领域。实质性结果包括 Hannenhalli 和 Pevzner 于 1995 年给出的反转距离的多项式时间可计算性,以及 Yancopoulos 等人于 2005 年引入的双切接(DCJ)距离。然而,这两个结果都依赖于这样一种假设:所比较的基因组包含相同的一组唯一标记(同线基因组区域,有时也称为基因)。2015 年,Shao、Lin 和 Moret 放宽了这一条件,允许分析中存在重复标记。这种广义的基因组距离问题是 NP 难的,他们给出了一个 ILP 解法,其效率足以应用于真实世界的数据集。他们方法的一个限制是只能应用于平衡基因组,即任何标记的重复数相等。因此仍需要对输入数据进行精细的预处理,以去除不平衡标记的过多拷贝。在本文中,我们提出一种求解自然基因组基因组距离问题的算法,其中任意标记可出现任意多次。我们的方法基于一种新的图数据结构——多关系图,它允许对 Shao、Lin 和 Moret 的 ILP 进行优雅的扩展,以计数在一个基因组中相对于另一个基因组代表性不足或过度的标记串,并分别需要插入或删除。借助这一扩展,先前对基因组构型的限制被解除,首次实现了无妥协的重排分析。任何标记序列都可直接用于距离计算。我们方法的评估表明,它可用于分析多达数万个标记的基因组,我们在模拟和真实数据上进行了演示。
引用
@article{arxiv.2001.02139,
title = {Computing the rearrangement distance of natural genomes},
author = {Leonard Bohnenkämper and Marília D. V. Braga and Daniel Doerr and Jens Stoye},
journal= {arXiv preprint arXiv:2001.02139},
year = {2021}
}