中文

通过权重和分布函数实现稳健且准确的数据富集统计

定量方法 2011-10-25 v2

摘要

术语富集分析通过将来自受控词汇表的术语注释分配给实验或计算获得的数据,从而促进生物学解释。该过程通常涉及获取每个词汇术语的统计显著性,并使用最显著的术语来描述一组给定的生物实体,这些实体通常带有权重。许多现有的富集方法需要选择(任意数量的)最显著实体,并且/或者不考虑实体的权重。其他方法要么强制进行大量模拟以获得统计量,要么假设权重服从正态分布。此外,大多数方法难以对实体数量较少的术语分配正确的统计显著性。我们实现了著名的Lugananni-Rice公式,开发了一种名为SaddleSum的新方法,该方法不受上述所有限制,并与几种现有方法进行了评估。在适当考虑实体权重的情况下,SaddleSum在内部是一致的,并且对于所选最显著实体数量的选择是稳定的。该方法对输入数据假设很少,因此具有普适性,可应用于微阵列分析之外的领域。利用渐近近似,SaddleSum提供了一个依赖于术语大小的得分分布函数,即使对于实体数量较少的术语也能产生准确的统计显著性。因此,SaddleSum使研究人员能够对其分配给通常生物学上最具特异性的小术语的显著性充满信心。

关键词

引用

@article{arxiv.1004.5088,
  title  = {Robust and accurate data enrichment statistics via distribution function of sum of weights},
  author = {Aleksandar Stojmirović and Yi-Kuo Yu},
  journal= {arXiv preprint arXiv:1004.5088},
  year   = {2011}
}

备注

Revised manuscript. 22 pages, 9 figures, 1 table