DNA 序列中稀有词搜索的泊松近似
概率论
2007-11-16 v1 统计理论
应用统计
统计理论
摘要
利用关于具有混合性质的随机过程中符号串出现时间的最新结果,我们提出了一种在通常由马尔可夫链建模的生物序列中搜索稀有词的新方法。我们获得了序列中词出现次数分布(在马尔可夫模型下)与其泊松近似之间误差的界限。Chen-Stein 方法已经给出了一个全局界限。我们的方法,即 psi-mixing 方法,提供了局部界限。由于我们只需要分布尾部的误差,Chen-Stein 的全局一致界限过大,因此考虑局部界限是更好的方法。我们搜索了两个关于出现次数的阈值,据此可以将所研究的词视为过代表或欠代表。我们为这些过代表或欠代表的词提出了生物学作用。与 Chen-Stein 方法相比,我们的方法为更广泛的词组提供了此类阈值。通过比较这两种方法,我们观察到 psi-mixing 方法在分布尾部界限上具有更高的准确性。我们还介绍了专用软件 PANOW(网址:http://stat.genopole.cnrs.fr/software/panowdir/),用于计算所研究词的误差项和阈值。
引用
@article{arxiv.0711.2382,
title = {Poisson approximation for search of rare words in DNA sequences},
author = {Nicolas Vergne and Miguel Abadi},
journal= {arXiv preprint arXiv:0711.2382},
year = {2007}
}
备注
29 pages, 0 figures