范例还是匹配:非等量内容基因组数据的DCJ问题建模
数据结构与算法
2017-05-29 v1 计算工程、金融与科学
基因组学
摘要
在DCJ模型下,对于内容相等或带有Indel的基因组,其编辑距离可以在多项式时间内计算。但在存在重复的情况下,该问题变为NP困难,特别是当考虑Indel时,这在很大程度上是一个未解决的问题。在本文中,我们比较了处理重复并将其与Indel关联的两种主流方法:一种是通过删除,即DCJ-Indel-范例距离;另一种是通过基因匹配,即DCJ-Indel-匹配距离。我们设计了带有优化方法集的分支定界算法来计算两者的精确距离。此外,结合这两种距离方法讨论了中位数问题,即寻找一个中位数基因组,使其自身与三个给定基因组之间的距离最小化。利用Lin-Kernighan (LK)启发式算法,并通过子图分解和搜索空间缩减技术进行增强,以处理中位数计算。在合成数据集和真实数据集上进行了广泛的实验,展示了这两种距离度量本身的优缺点,并将它们置于中位数计算场景中进行评估。
引用
@article{arxiv.1705.06559,
title = {Exemplar or Matching: Modeling DCJ Problems with Unequal Content Genome Data},
author = {Zhaoming Yin and Jijun Tang and Stephen W. Schaeffer and David A. Bader},
journal= {arXiv preprint arXiv:1705.06559},
year = {2017}
}
备注
17 pages