生物序列中 k-词匹配的实证分布
定量方法
2009-09-08 v1 基因组学
摘要
本研究聚焦于一种无比对的序列比较方法:两个序列之间共享的长度为 k 的词的数量,也称为 统计量。使用该统计量相较于基于比对的方法,其优势首先在于它不假设同源片段是连续的,其次在于该算法在计算上极其快速,运行时间与所检查序列的大小成正比。 统计量的现有应用包括在大型 EST 数据库(如 STACK 数据库)中对相关序列进行聚类。此类应用通常依赖于缺乏任何统计基础的启发式方法。随后已对 分布进行了严格的统计刻画,但这些工作集中于分布的渐近行为,导致在大多数实际情况下 的分布仍未被刻画。本文 presented 的工作 bridging 了这两个领域,为生物序列研究中最常遇到的参数范围提供了 分布的可用近似。
引用
@article{arxiv.0803.2085,
title = {Empirical distribution of k-word matches in biological sequences},
author = {Sylvain Foret and Susan R. Wilson and Conrad J. Burden},
journal= {arXiv preprint arXiv:0803.2085},
year = {2009}
}
备注
23 pages, 10 figures