中文

DNA的马尔可夫语言模型及其信息内容

生物物理 2015-10-09 v1 其他定量生物学

摘要

本研究提出了一种用于DNA的马尔可夫无记忆模型,极大地简化了DNA的复杂性。我们将核苷酸序列编码为称为“词”的符号序列,从中确立有意义的词长以及共享符号相似性的词组。将节点解释为表示一组相似词,将边表示为它们的功能连接,这使我们能够构建支配DNA中词组出现规律的语法规则网络。我们的模型能够以空前的准确度预测DNA中词组之间的转移,并轻松计算许多信息量以更好地表征DNA。此外,我们将已知细菌的DNA简化为仅有数十个节点的网络,展示了我们的模型如何用于检测不同生物体中相似(或不相似)的基因,以及哪些符号序列负责DNA的大部分信息内容。因此,DNA确实可以作为一种语言、一种马尔可夫语言来处理,其中“词”是一个组的元素,其语法表示任意两个组之间转移概率背后的规则。

关键词

引用

@article{arxiv.1510.02375,
  title  = {Markovian language model of the DNA and its information content},
  author = {Shambhavi Srivastava and Murilo S. Baptista},
  journal= {arXiv preprint arXiv:1510.02375},
  year   = {2015}
}

备注

17 pages and 5 figures