针对超大规模检验问题的 Benjamini-Hochberg FDR 控制过程的更实用方法
统计方法学
2015-01-22 v1
摘要
我们解决了大规模数据分析中的一个常见问题,特别是在遗传学领域,即超大规模检验问题,其中数百万至数十亿的假设同时被检验,这对执行多重假设检验过程构成了计算挑战。作为解决方案,我们提出了一种替代 Benjamini 和 Hochberg (1995) 广泛使用的线性逐步向上(Linear Step Up)过程的算法。我们的算法需要线性时间,且不需要任何 p 值排序。它允许将超大规模检验问题任意分割为计算上可行的集合或块。我们的算法将各块的结果结合起来,产生与在整个检验集上执行控制过程相同的结果,从而即使 p 值被任意划分也能控制全局错误发现率(FDR)。实际内存使用量也可根据可用内存大小任意确定。
引用
@article{arxiv.1501.05225,
title = {A more practical approach for the Benjamini-Hochberg FDR controlling procedure for huge-scale testing problems},
author = {Vered Madar and Sandra Batista},
journal= {arXiv preprint arXiv:1501.05225},
year = {2015}
}