中文

基于混合序列数据已知单倍型频率的最大似然估计

定量方法 2013-02-07 v1 基因组学

摘要

DNA 样本经常被混合,这可能是出于实验设计,或者因为样本本身就是混合物。例如,当主要关注群体等位基因频率时,可以将个体样本混合在一起以降低测序成本。或者,样本本身可能是多种物种或菌株的混合物(例如构成微生物组的细菌物种,或血液样本中的病原体菌株)。我们提出了一种期望最大化 (EM) 算法,用于在已知可能单倍型的情况下,直接从比对后的序列读段中估计混合样本中的单倍型频率。该方法适用于选择实验中的混合测序数据分析,以及宏基因组样本中不同菌株比例的计算。我们的方法优于基于单一位点等位基因频率的现有方法,以及使用序列读段数据的简单方法。我们已将该方法实现为一个免费开源的软件工具。

关键词

引用

@article{arxiv.1209.4128,
  title  = {Maximum Likelihood Estimation of Frequencies of Known Haplotypes from Pooled Sequence Data},
  author = {Darren Kessner and Tom Turner and John Novembre},
  journal= {arXiv preprint arXiv:1209.4128},
  year   = {2013}
}

备注

23 pages, 8 figures