中文

随机集方法识别基因集分析中富集信号的不同方面

应用统计 2009-09-29 v1

摘要

预先指定的一组基因可能在两种或多种细胞状态下,对表达水平发生改变的基因表现出不同程度的富集。了解由功能类别(如基因本体论(GO)注释)定义的基因集的富集情况,对于分析微阵列表达数据中的生物学信号非常有价值。衡量富集的一种常见方法是根据基因在功能类别中的成员资格和在显著改变基因选定列表中的成员资格对基因进行交叉分类。例如,在该 2×22\times2 列联表中,较小的 Fisher 精确检验 pp 值表明存在富集。其他类别分析方法保留定量基因水平得分,并通过将类别水平统计量与原始差异表达问题相关的排列分布进行比较来衡量显著性。我们描述了一类随机集评分方法,用于测量富集信号的不同组成部分。该类别包括基于选定基因的 Fisher 检验,以及对类别中基因水平证据进行平均的检验。使用鼻咽癌组织的 Affymetrix 表达数据进行实证比较,并使用差异表达的位置模型进行理论比较,对比了平均法和选择法。我们发现,每种方法在富集问题的状态空间中都有其优势领域,且两种方法在实践中均有益处。我们的分析还涉及与多类别推断相关的两个问题:即如果大小不同,等量富集的类别不会以相等的概率被检测到,以及由于共享基因导致类别统计量之间存在依赖性。随机集富集计算实现时不需要蒙特卡洛方法。它们已在 R 包 allez 中提供。

关键词

引用

@article{arxiv.0708.4350,
  title  = {Random-set methods identify distinct aspects of the enrichment signal in gene-set analysis},
  author = {Michael A. Newton and Fernando A. Quintana and Johan A. den Boon and Srikumar Sengupta and Paul Ahlquist},
  journal= {arXiv preprint arXiv:0708.4350},
  year   = {2009}
}

备注

Published at http://dx.doi.org/10.1214/07-AOAS104 in the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)