中文

密集分类单元抽样下 TKF91 模型中祖先 DNA 序列的统计一致且计算高效的推断

种群与进化 2019-08-02 v3 计算工程、金融与科学 概率论 统计理论 统计理论

摘要

在进化生物学中,生物的物种形成历史通过系统发育树图形化表示,即一棵有根树,其叶子对应于现存物种,分支表示过去的物种形成事件。系统发育树通常根据从感兴趣物种收集的分子序列(如 DNA 序列)来估计。在高层级上,该推断背后的思想很简单:两个物种在生命之树中相距越远,自其最近共同祖先以来其基因组中积累的突变数量就越多。为了在系统发育分析中获得准确估计,标准做法是采用基于树上序列进化的随机模型的统计方法。为了可处理性,此类模型必然对涉及的进化机制做出简化假设。特别是,通常忽略核苷酸的插入和缺失——也称为 indels。在统计系统发育分析中正确考虑 indels 仍是计算进化生物学中的一个主要挑战。在此,我们考虑在已知系统发育树上重建祖先序列的问题,采用一种包含核苷酸替换、插入和缺失的序列进化模型,具体为经典的 TKF91 过程。我们关注有界高度密集系统发育树的情况,称之为分类单元丰富(taxon-rich)情形,其中统计一致性是可实现的。我们给出了第一个在恒定突变率下具有可证明保证的多项式时间祖先重建算法。当系统发育树满足“大爆炸”(big bang)条件时,我们的算法成功,该条件是此背景下统计一致性的充要条件。

关键词

引用

@article{arxiv.1707.05711,
  title  = {Statistically consistent and computationally efficient inference of ancestral DNA sequences in the TKF91 model under dense taxon sampling},
  author = {Wai-Tong Louis Fan and Sebastien Roch},
  journal= {arXiv preprint arXiv:1707.05711},
  year   = {2019}
}

备注

Title modified, 31 pages, 2 Figures and 1 table