基于算法概率的无训练测度识别 DNA 序列中的高核小体占据率
定量方法
2018-10-18 v3 信息论
math.IT
基因组学
摘要
我们引入并研究了一组基于信息论和算法复杂性本质的无训练方法,应用于 DNA 序列以识别其决定核小体结合位点的潜在能力。我们在来自不同来源、大小不同的已充分研究的基因组序列上测试了我们的测度。这些测度揭示了已知的体内与体外预测差异,并揭示了它们精确定位(高)核小体占据率的潜力。我们探索了核小体长度内外的不同可能信号,发现复杂性指数对核小体占据率具有信息性。我们与金标准(Kaplan 模型)进行了比较,发现了相似且互补的结果,主要区别在于我们的序列复杂性方法。例如,对于高占据率,基于复杂性的评分在预测结合方面优于 Kaplan 模型,这代表了在遵循无训练方法预测最高核小体占据率方面的一项显著进展。
引用
@article{arxiv.1708.01751,
title = {Training-free Measures Based on Algorithmic Probability Identify High Nucleosome Occupancy in DNA Sequences},
author = {Hector Zenil and Peter Minary},
journal= {arXiv preprint arXiv:1708.01751},
year = {2018}
}
备注
8 pages main text (4 figures), 12 total with Supplementary (1 figure)