表征D2统计量:生物序列中的词匹配
定量方法
2009-09-09 v1 基因组学
应用统计
摘要
词匹配常用于序列比较方法中,或作为序列相似性的度量,或用于BLAST或BLAT等算法的初始搜索步骤。D2统计量是两个序列之间长度为k的词的匹配数。近年来,在表征该统计量及其分布近似方面取得了进展。本文将结果推广到近似词匹配的情形。我们计算了均匀字母分布情况下D2统计量方差的精确值,并引入了一种方法,为其余情况提供方差的精确近似。这使得D2的分布能够近似用于生物学研究中出现的典型情况。我们将这些结果应用于顺式调控模块的识别,并表明该方法能以高精度检测此类序列。能够近似精确和近似词匹配的D2分布,将使该统计量能够更精确地用于序列比较、数据库搜索和转录因子结合位点的识别。
引用
@article{arxiv.0909.1370,
title = {Characterising the D2 statistic: word matches in biological sequences},
author = {Sylvain Foret and Susan R. Wilson and Conrad J. Burden},
journal= {arXiv preprint arXiv:0909.1370},
year = {2009}
}
备注
23 pages, 3 figures