多群体联合样本频率谱的高效计算
概率论
2016-03-03 v1 种群与进化
摘要
群体遗传学中的广泛研究采用了样本频率谱 (SFS),这是一种描述 DNA 序列样本中多态性位点突变等位基因分布的汇总统计量。特别是,最近人们越来越有兴趣分析来自多个群体的联合 SFS 数据,以推断复杂人口历史模型的参数,包括可变群体大小、群体分裂时间、迁移率、混合比例等。尽管方法论已取得很大进展,但当涉及多个群体且样本量较大时,现有的基于 SFS 的推断方法存在数值不稳定和计算复杂度高的问题。在本文中,我们提出了新的解析公式和算法,能够高效计算由复杂人口模型(包括任意群体大小历史,含分段指数增长)关联的多个群体的期望联合 SFS。我们的结果已在一个名为 momi (MOran Models for Inference) 的新软件包中实现。通过对涉及数十个群体的实证研究,我们展示了我们在数值稳定性和计算复杂度方面的改进。
引用
@article{arxiv.1503.01133,
title = {Efficient computation of the joint sample frequency spectra for multiple populations},
author = {John A. Kamm and Jonathan Terhorst and Yun S. Song},
journal= {arXiv preprint arXiv:1503.01133},
year = {2016}
}
备注
24 pages, 5 figures