中文

走向对DNA基序发现中假阳性的理论理解

基因组学 2010-12-23 v1

摘要

假阳性基序的检测是基序发现方法性能低下的主要原因之一。通常认为假阳性主要源于基序发现算法的弱点。然而,本文推导了假阳性对数据集大小的理论依赖性,并发现假阳性可能由大数据集大小引起,而与所用算法无关。有趣的是,假阳性的强度更多地取决于数据集中的序列数量,而非序列长度。正如预期,假阳性可以通过减少序列长度或向数据集中添加更多序列来降低。然而,对序列数量的依赖性会减弱并达到一个平台期,此后向数据集中添加更多序列不会显著降低假阳性率。基于本文提出的理论结果,我们提供了一些直观的经验法则,可用于在实践中增强基序发现结果。

关键词

引用

@article{arxiv.1012.5011,
  title  = {Towards a theoretical understanding of false positives in DNA motif finding},
  author = {Amin Zia and Alan M. Moses},
  journal= {arXiv preprint arXiv:1012.5011},
  year   = {2010}
}

备注

Submitted to PLOS Computational Biology