一种用于DNA进化等待时间的自动机方法
离散数学
2011-12-02 v1 计算工程、金融与科学
形式语言与自动机理论
种群与进化
摘要
在最近的一篇文章中,Behrens和Vingron (JCB 17, 12, 2010) 在假定所考虑的k-mer不出现在初始DNA序列中的条件下,计算了DNA进化过程中k-mer出现的等待时间;这是在研究调控DNA序列演化与转录因子(TF)结合位点出现相关问题时产生的一个议题。其计算所依据的数学分析假设感兴趣的词的出现不重叠。我们在此通过使用自动机方法放宽了这一假设。在大小为4的字母表(如DNA字母表)中,大多数词没有自相关或自相关性较低;因此,总体上,我们的结果证实了Behrens和Vingron的结论。当考虑高度自相关的k-mer时,结果差异显著;在这种情况下,自相关降低了这些k-mer在第1代出现的概率,从而将这些k-mer出现的等待时间最多增加了40%。对现有TF结合位点的分析揭示了相当比例的k-mer表现出自相关性。因此,我们基于自动机的计算极大地提高了预测DNA进化过程中TF结合位点出现等待时间的准确性。我们在Bernoulli模型或M0模型中进行计算;在M1模型(1阶Markov模型)中的计算在时间和内存方面成本更高,但应产生类似的结果。虽然Behrens和Vingron专门考虑了长度为1000的启动子,但我们将结果推广到任意大小的启动子;我们展示了k-mer在第0代不存在而在第1代出现的概率相对于启动子长度呈线性变化的性质,这导致任意k-mer的等待时间相对于启动子长度呈双曲型变化。
引用
@article{arxiv.1112.0126,
title = {An automaton approach for waiting times in DNA evolution},
author = {S. Behrens and C. Nicaud and P. Nicodeme},
journal= {arXiv preprint arXiv:1112.0126},
year = {2011}
}
备注
8 figures