捉迷藏:为数千个富含同塑性的序列放置和寻找最优树
种群与进化
2013-06-07 v1
摘要
从序列数据中寻找最优进化树通常是一个难解问题,而且通常无法得知通过某种搜索得到的最佳树距离真正的最优树有多近。当分类单元 (taxa) 数量众多且数据具有高水平同塑性 (homoplasy)(即单个特征需要多次变化才能适配到最佳树上)时,这一问题似乎尤为尖锐。然而,最近的一项数学结果提供了一种精确工具,可为任意给定树生成少量高同塑性特征,从而证明该树在最大简约法 (maximum parsimony) 准则下确为最优树。这首次提供了一种严格的方法来测试针对富含同塑性数据的树搜索算法,因为我们预先知晓“最佳”树是什么。在这篇短文中,我们仅考虑一种搜索程序 (TNT),但表明它能够正确定位 32,768 个分类单元的全局最优树,尽管数据集中的特征平均每个需要 1148 次状态变化才能适配到该树上,且特征数量仅为 57 个。
引用
@article{arxiv.1306.1339,
title = {Hide and seek: placing and finding an optimal tree for thousands of homoplasy-rich sequences},
author = {Dietrich Radel and Andreas Sand and Mike Steel},
journal= {arXiv preprint arXiv:1306.1339},
year = {2013}
}
备注
8 pages, 2 figures, 1 table