中文

生物序列中 k-词匹配的实证分布

定量方法 2009-09-08 v1 基因组学

摘要

本研究聚焦于一种无比对的序列比较方法:两个序列之间共享的长度为 k 的词的数量,也称为 D2D_2 统计量。使用该统计量相较于基于比对的方法,其优势首先在于它不假设同源片段是连续的,其次在于该算法在计算上极其快速,运行时间与所检查序列的大小成正比。D2D_2 统计量的现有应用包括在大型 EST 数据库(如 STACK 数据库)中对相关序列进行聚类。此类应用通常依赖于缺乏任何统计基础的启发式方法。随后已对 D2D_2 分布进行了严格的统计刻画,但这些工作集中于分布的渐近行为,导致在大多数实际情况下 D2D_2 的分布仍未被刻画。本文 presented 的工作 bridging 了这两个领域,为生物序列研究中最常遇到的参数范围提供了 D2D_2 分布的可用近似。

关键词

引用

@article{arxiv.0803.2085,
  title  = {Empirical distribution of k-word matches in biological sequences},
  author = {Sylvain Foret and Susan R. Wilson and Conrad J. Burden},
  journal= {arXiv preprint arXiv:0803.2085},
  year   = {2009}
}

备注

23 pages, 10 figures