中文

基因组序列中最小缺失词的主体与尾部

基因组学 2016-05-04 v1 生物物理

摘要

基因组序列的最小缺失词(MAW)是指其自身不存在于序列中,但其所有子词均存在于序列中的子序列。观察到所有生物体基因组 MAW 随其长度变化的特征分布在定性上是相似的,主体部分相当短,而只有相对较少的部分较长。这一现象背后的原因是统计学上的还是反映了某种生物学机制,以及缺失词中包含何种生物学信息,一直是一个悬而未决的问题。在本工作中,我们证明主体部分可以通过从随机序列中采样词汇的概率模型来描述,而长 MAW 的尾部则具有生物学起源。我们引入了最小缺失词核心这一新概念,即存在于基因组中且最接近给定 MAW 的序列。我们表明,在细菌和酵母中,以两个或多个拷贝存在的最长 MAW 的核心位于高度保守的区域,其中最突出的例子是核糖体 RNA(rRNA)。我们还表明,尽管长 MAW 的核心在这些基因组中的分布在粗粒化水平上大致是均匀的,但在更精细的水平上,它在 3' 非翻译区(UTR)强烈富集,在较小程度上也在 5' UTR 富集。这表明 MAW 及其相关的 MAW 核心对应于微调的进化关系,并暗示它们可以更广泛地用作基因组复杂性的标记。

关键词

引用

@article{arxiv.1509.05188,
  title  = {The Bulk and The Tail of Minimal Absent Words in Genome Sequences},
  author = {Erik Aurell and Nicolas Innocenti and Hai-Jun-Zhou},
  journal= {arXiv preprint arXiv:1509.05188},
  year   = {2016}
}

备注

Supplemental Information to the paper is available as ancillary file