重新审视DNA进化中的等待时间
离散数学
2012-05-30 v1
摘要
转录因子是主要位于启动子序列中的短DNA片段(或k-mer),可增强或抑制基因表达。基于DNA字母表的初始字母分布,Behrens和Vingron考虑一个长度为n的随机序列,该序列不包含给定的k-mer或大小为k的词。在DNA进化模型下,他们计算了该k-mer在20年单位时间后出现的概率p_n。他们证明k-mer首次出现的等待时间近似为T_n=1/p_n。他们的工作依赖于k-mer不自重叠的简化假设。他们特别观察到等待时间主要由初始字母分布驱动。Behrens等人使用自动机方法放宽了与词重叠相关的假设。他们的数值评估证实了Behrens和Vingron方法对非自重叠词的有效性,但对高度自重叠词(如AAAAA)提供了高达44%的修正。我们设计了一种通过团簇分析和生成函数的方法;该方法证明了对于大范围的n值,p_n具有准线性行为,这是DNA进化的重要结果。我们在此介绍这种团簇分析,首先通过语言分解,然后通过自动机构造;最后,我们描述了通过马尔可夫自动机构造的等效方法。
引用
@article{arxiv.1205.6420,
title = {Revisiting Waiting Times in DNA evolution},
author = {Pierre Nicodeme},
journal= {arXiv preprint arXiv:1205.6420},
year = {2012}
}
备注
19 pages, 3 Figures, 2 Tables