中文

独立基因列表交集的统计检验:灵敏度、FDR与第一类错误控制

应用统计 2012-06-29 v1

摘要

公共数据存储库使研究人员能够跨多个基因组研究比较结果以复制发现。一种常见的方法是首先在每个研究中根据感兴趣的假设对基因进行排序。然后,比较各研究中排名靠前的基因列表。在多个研究中被重新捕获为高排名(通常高于某个阈值)的基因被认为是显著的。然而,这种比较策略通常是非正式的,因为第一类错误和错误发现率(FDR)通常不受控制。在本文中,我们形式化了这种列表交集发现检验的推断策略。我们展示了如何计算与“重新捕获”基因集相关的p值,使用封闭形式的泊松近似来近似重新捕获集大小的分布。我们研究了检验的操作特性,作为所考虑研究总数、每个研究内的排名阈值以及基因必须被重新捕获的研究数量的函数。我们研究了FDR控制与期望灵敏度(被识别为显著的真阳性基因的期望比例)之间的权衡。我们提供了关于如何设计生物信息学列表交集研究的实用指导,以最大化期望灵敏度并预先指定第一类错误(在集合水平)和错误发现率(在基因水平)的控制。我们展示了参数的最优选择如何依赖于可能成立的特定备择假设。我们使用来自Oncomine数据库的前列腺癌基因表达数据集说明我们的方法,并讨论基因间依赖性对检验的影响。

关键词

引用

@article{arxiv.1206.6636,
  title  = {Statistical tests for the intersection of independent lists of genes: Sensitivity, FDR, and type I error control},
  author = {Loki Natarajan and Minya Pu and Karen Messer},
  journal= {arXiv preprint arXiv:1206.6636},
  year   = {2012}
}

备注

Published in at http://dx.doi.org/10.1214/11-AOAS510 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)