中文

pplacer:将序列线性时间最大似然与贝叶斯系统发育定位到固定参考树上

种群与进化 2010-04-01 v1 基因组学

摘要

基于似然的系统发育推断通常被认为是未知序列最可靠的分类方法。然而,由于计算复杂性问题以及缺乏系统发育信号,传统的基于似然的系统发育方法无法应用于来自下一代测序的大量短读段。“系统发育定位”是一种将参考树固定,并通过参考比对将未知查询序列放置到树上的方法,它能够将基于似然的方法的推断能力应用于大型数据集。本文介绍了 pplacer,一个用于系统发育定位及后续可视化的软件包。该算法每个处理器每小时可将两万条短读段定位到包含一千个分类单元的参考树上,在参考分类单元数量上具有基本线性的时间和内存复杂度,并且易于并行运行。Pplacer 具有计算边上定位后验概率的功能,这是一种在逐边基础上量化不确定性的统计严谨方法。它还可以通过计算定位位置之间的期望距离来告知用户查询序列的位置不确定性,这对于在采样良好的参考树上估计不确定性至关重要。该软件使用分支粗细和颜色来表示定位数量及其不确定性。一项使用从 631 个 COG 比对生成的读段进行的模拟研究表明,系统发育定位在广泛的比对多样性范围内具有高精度,并且边缘不确定性估计在衡量定位置信度方面具有强大能力。Pplacer 实现了高效的系统发育定位及后续可视化,使得基于似然的系统发育方法学对于大量读段集合变得实用;它提供源代码、二进制文件和网络服务。

关键词

引用

@article{arxiv.1003.5943,
  title  = {pplacer: linear time maximum-likelihood and Bayesian phylogenetic placement of sequences onto a fixed reference tree},
  author = {Frederick A Matsen and Robin B Kodner and E Virginia Armbrust},
  journal= {arXiv preprint arXiv:1003.5943},
  year   = {2010}
}