如何在海量数据中定位显著信号?
统计方法学
2021-04-13 v2
摘要
在多重比较的许多现有方法中,人们通常从 Fisher 的 p 值或局部错误发现率(local fdr)分数出发。前者通常定义为零分布下超过观测检验统计量的尾概率,未能利用备择假设的信息,且目标信号区域可能完全错误,尤其在似然比函数非单调时。基于局部 fdr 的方法通常依赖密度函数,在预言(oracle)意义下是最优的。然而,由于非参数密度估计收敛缓慢,尤其在边界处,数据驱动版本的信号目标区域存在问题。本文提出一种新方法:累积分布函数与局部 fdr 辅助多重检验方法(CLAT),在基于 p 值的方法失效的情形下是最优的。此外,数据驱动版本仅依赖累积分布函数的估计,并能快速收敛至预言版本。模拟与真实数据分析均表明所提方法优于现有方法。进一步,基于一种新颖算法,计算可瞬时完成,并可扩展至大型数据集。
引用
@article{arxiv.1910.02597,
title = {Where to find needles in a haystack?},
author = {Zhigen Zhao},
journal= {arXiv preprint arXiv:1910.02597},
year = {2021}
}
备注
25 pages