中文

针对潜变量校正的多重假设检验及其在 AGEMAP 基因表达数据中的应用

应用统计 2013-01-14 v1

摘要

在高通量设置中,我们检查大量候选变量(例如基因)以寻找其与主要变量(例如表型)的关联。系统性效应和其他潜变量的存在使得高通量假设检验变得困难。众所周知,这些变量会改变检验水平并在检验之间诱导相关性。它们还会改变假设间显著性水平的相对排序。糟糕的排序会导致后续研究既浪费又无效。对于与主要变量相关的潜变量,这一问题尤为尖锐。我们提出了一种两阶段分析方法来抵消潜变量对假设排序的影响。我们的方法称为 LEAPP,它在统计上将潜变量与主要变量隔离开来。在模拟中,该方法比 SVA 和 EIGENSTRAT 等竞争方法能提供更好的假设排序。作为示例,我们转向 AGEMAP 研究的数据,该研究涉及小鼠 16 种组织中基因表达与年龄的关系。与其他方法获得的排序相比,LEAPP 生成的排序在不同组织间具有更高的一致性。

关键词

引用

@article{arxiv.1301.2420,
  title  = {Multiple hypothesis testing adjusted for latent variables, with an application to the AGEMAP gene expression data},
  author = {Yunting Sun and Nancy R. Zhang and Art B. Owen},
  journal= {arXiv preprint arXiv:1301.2420},
  year   = {2013}
}

备注

Published in at http://dx.doi.org/10.1214/12-AOAS561 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)