中文

样本量极大时谱系性质的畸变

种群与进化 2015-06-24 v1

摘要

人类遗传学中的研究样本量正在迅速增长,不久之后,分析包含数十万甚至数百万个体的样本将成为常规。除了带来计算挑战外,如此大的样本量也要求仔细重新审视常用分析工具背后的理论基础。在此,我们研究了合并过程 (coalescent) 的准确性,这是研究个体样本祖先关系的核心模型。合并过程作为一大类随机交配模型的极限而出现,只要种群规模足够大于样本规模,它就是原始模型的准确近似。我们开发了一种在离散时间 Wright-Fisher (DTWF) 模型中进行精确计算的方法,并将几个关键的谱系关注量与合并过程的预测进行了比较。对于现实的人口统计场景,我们发现 DTWF 模型下存在大量多重合并和同时合并事件,而这些在合并过程中因构造原因而不存在。此外,对于大样本量,合并过程与 DTWF 模型之间在稀有变异的预期数量上存在显著差异。为了平衡准确性与计算效率之间的权衡,我们提出了一种混合算法,利用 DTWF 模型处理近期历史,利用合并过程处理更久远的历史。我们的结果表明,仅包含几代 DTWF 模型的混合方法所产生的频率谱与完整 DTWF 模型的预测非常接近。

关键词

引用

@article{arxiv.1308.0091,
  title  = {Distortion of genealogical properties when the sample is very large},
  author = {Anand Bhaskar and Andrew G. Clark and Yun S. Song},
  journal= {arXiv preprint arXiv:1308.0091},
  year   = {2015}
}

备注

27 pages, 2 tables, 14 figures