中文

测量序列数据对系统发育模型的拟合度:使用边际检验提高检验功效

种群与进化 2008-12-31 v1 基因组学

摘要

检验数据对模型的拟合度在任何科学领域都至关重要,但系统发育学领域的出版物很少进行此类检验。这些分析忽略了卡尔·波普尔所规定的科学的基本方面。事实上,波普尔(1978)曾不无道理地认为进化生物学是不科学的,因为其假设无法检验。在此,我们追溯了从Penny等人(1982)至今评估拟合度的发展历程。我们比较了进化树模型与多项模型之间的广义对数似然比(G或G2统计量)统计量,以及应用于序列比对(使用胎盘哺乳动物编码序列数据)的边际化检验。结果表明,最一般的检验并未拒绝数据对模型的拟合(p~0.5),但边际化检验却拒绝了。对成对频率(F)矩阵的检验强烈(p < 0.001)拒绝了目前普遍使用的最一般的系统发育(GTR)模型。同样清楚的是(p < 0.01),这些序列的核苷酸组成并非平稳的。偏离平稳性和同质性的情况似乎在分类群中分布不均;并不一定是通过检查基因组其他区域所预期的那样。通过将独立同分布模型的4^t模式边际化为观测到的和期望的简约计数,即从恒定位点、到单态位点、再到最小可能长度的简约信息位点,似然比检验恢复了检验功效,并且它也以p << 0.001拒绝了进化模型。鉴于在相对较近的进化时间尺度上存在这种行为,读者普遍应对结果保持健康的怀疑态度,因为已发表分析中系统误差的规模可能远比分析方法(例如自举法)所报告的要大得多。

关键词

引用

@article{arxiv.0812.5005,
  title  = {Measuring Fit of Sequence Data to Phylogenetic Model: Gain of Power using Marginal Tests},
  author = {Peter J. Waddell and Rissa Ota and David Penny},
  journal= {arXiv preprint arXiv:0812.5005},
  year   = {2008}
}