中文

表征D2统计量:生物序列中的词匹配

定量方法 2009-09-09 v1 基因组学 应用统计

摘要

词匹配常用于序列比较方法中,或作为序列相似性的度量,或用于BLAST或BLAT等算法的初始搜索步骤。D2统计量是两个序列之间长度为k的词的匹配数。近年来,在表征该统计量及其分布近似方面取得了进展。本文将结果推广到近似词匹配的情形。我们计算了均匀字母分布情况下D2统计量方差的精确值,并引入了一种方法,为其余情况提供方差的精确近似。这使得D2的分布能够近似用于生物学研究中出现的典型情况。我们将这些结果应用于顺式调控模块的识别,并表明该方法能以高精度检测此类序列。能够近似精确和近似词匹配的D2分布,将使该统计量能够更精确地用于序列比较、数据库搜索和转录因子结合位点的识别。

关键词

引用

@article{arxiv.0909.1370,
  title  = {Characterising the D2 statistic: word matches in biological sequences},
  author = {Sylvain Foret and Susan R. Wilson and Conrad J. Burden},
  journal= {arXiv preprint arXiv:0909.1370},
  year   = {2009}
}

备注

23 pages, 3 figures