中文

基于拓扑压力的编码序列密度估计

动力系统 2014-01-09 v4 数据分析、统计与概率 定量方法

摘要

我们提出了一种基于拓扑压力的基因组分析中编码序列(CDS)密度估计的新方法,该方法源于遍历理论中的一个著名概念。拓扑压力衡量有限词的“加权信息含量”,并包含64个参数,这些参数可解释为每个核苷酸三联体的权重选择。我们训练这些参数,使得拓扑压力拟合人类基因组上观察到的编码序列密度,并利用此方法对小鼠、恒河猴和黑腹果蝇基因组上约66,000bp窗口内的CDS密度进行从头预测。虽然这些基因组之间的差异太大,以至于不能期望在人类基因组上的训练能够预测例如基因的确切位置,但我们证明了我们的方法为预测CDS密度的“粗尺度”问题提供了合理的估计。再次受遍历理论启发,从训练过程中获得的核苷酸三联体权重用于定义有限序列上的概率分布,该分布可用于区分人类基因组中长度在750bp到5,000bp之间的内含子和外显子序列。在论文末尾,我们解释了我们方法的理论基础,即来自动力系统文献的热力学形式理论。我们的方法的Mathematica和MATLAB实现可在http://sourceforge.net/projects/topologicalpres/获取。

关键词

引用

@article{arxiv.1109.5999,
  title  = {Coding Sequence Density Estimation Via Topological Pressure},
  author = {David Koslicki and Daniel J. Thompson},
  journal= {arXiv preprint arXiv:1109.5999},
  year   = {2014}
}

备注

From v3, changes to typesetting only. The paper is accepted for publication in the Journal of Mathematical Biology