中文

基于复杂性理论识别染色体内核苷酸序列的信息与有序性:一种集成方法论

生物物理 2020-04-24 v1 其他定量生物学

摘要

利用复杂性度量和机器学习(ML)模型,分析了 22 条人类染色体中 exon、intron、基因间区及重复/独特 DNA 序列等片段基因组实体的长度。本研究旨在评估这些序列尺寸分布中可能隐藏的信息与有序性。为此,我们开发了一种创新的集成方法论。我们的分析基于重构相空间定理、Tsallis 非广延统计理论、ML 技术,以及一个整合所生成信息的新技术指标,我们将其引入并命名为复杂性因子(COFA)。DNA 序列的低维确定性非线性混沌与非广延统计特征得到验证,具有强多重分形特性和长程关联,且随基因组实体与染色体有显著变化。分析结果显示,各基因组实体与染色体在单个基因组片段尺寸分布上的复杂性行为存在差异。所有染色体中,intron 区域长度相较 exonic 区域在各项度量上表现出更强的复杂性行为,具有更长程关联与更强记忆效应。我们由分析得出结论:染色体内核苷酸区域尺寸分布并非随机,而是遵循具有特征形态的特有模式,此处通过其复杂性特征得以显现,并且根据复杂性理论,它是全基因组动力学的一部分。这一由 ML 工具在聚类、分类与预测中识别的 DNA 信息冗余动力学图景由此呈现。

关键词

引用

@article{arxiv.2004.11287,
  title  = {Information and order of genomic sequences within chromosomes as identified by complexity theory. An integrated methodology},
  author = {L. P. Karakatsanis and E. G. Pavlos and G. Tsoulouhas and G. L. Stamokostas and T. L. Mosbruger and J. L. Duke and G. P. Pavlos and D. S. Monos},
  journal= {arXiv preprint arXiv:2004.11287},
  year   = {2020}
}

备注

28 pages, 15 figures