中文

通过互信息估计识别基因组序列中的统计依赖性

基因组学 2007-10-30 v1 信息论 math.IT

摘要

理解和量化生物体中信息的表示与含量已成为生物学研究的核心部分,因为它们可能掌握着取得根本性进展的关键。在本文中,我们展示了利用信息论工具来识别统计相关的生物分子(DNA 或 RNA)片段。我们开发了一种基于互信息概念的精确可靠方法,用于查找和提取统计及结构依赖性。定义了一个简单的阈值函数,并探讨了其在量化生物片段间依赖性显著性水平方面的应用。这些工具被用于两个具体应用中。首先,用于识别玉米 zmSRp32 基因不同部分之间的相关性。在那里,我们发现 zmSRp32 的 5'非翻译区与其可变剪接外显子之间存在显著依赖性。这一观察结果可能表明存在尚未知的可变剪接机制或结构支架。其次,利用美国联邦调查局联合 DNA 索引系统 (CODIS) 的数据,我们证明了我们的方法特别适用于发现短串联重复序列,这是遗传 profiling 中的重要应用。

关键词

引用

@article{arxiv.0710.5190,
  title  = {Identifying statistical dependence in genomic sequences via mutual information estimates},
  author = {H. M. Aktulga and I. Kontoyiannis and L. A. Lyznik and L. Szpankowski and A. Y. Grama and W. Szpankowski},
  journal= {arXiv preprint arXiv:0710.5190},
  year   = {2007}
}

评论

Preliminary version. Final version in EURASIP Journal on Bioinformatics and Systems Biology. See http://www.hindawi.com/journals/bsb/

R2 v1 2026-06-29T05:10:19.858Z