中文

最优协变量加权提升高通量生物学中的发现率

统计方法学 2022-03-14 v1

摘要

高通量生物数据所固有的大规模多重检验需要极高的统计严格性,因此除非效应量较大,否则数据中真实的效应很难被检测到。一种有前景的减轻多重检验负担的方法是利用独立信息对最可能为真实效应的特征进行优先排序。然而,有效利用独立数据具有挑战性,且往往不能带来显著的效能提升。当前最先进的方法根据独立信息将特征划分为若干组,并为每组计算权重。然而,当真实效应微弱且罕见时(高通量生物学研究的典型情况),所有组都将包含大量零检验,因此其权重被稀释,性能受损。我们提出协变量秩加权(Covariate Rank Weighting, CRW),一种基于外部协变量对检验排序计算近似最优权重的方法。该方法利用协变量排序与检验效应量之间的概率关系,为每个检验计算比组权重更具信息量且不被零效应稀释的个体化权重。我们展示了该关系在协变量服从正态分布时如何从理论上计算,在其他情况下亦可经验估计。我们通过模拟及数据应用表明,在生物数据常见的罕见/低效应量场景下,该方法优于现有方法达10倍之多,且在所有场景中至少具有可比性能。

关键词

引用

@article{arxiv.2203.05926,
  title  = {Optimal Covariate Weighting Increases Discoveries in High-throughput Biology},
  author = {Mohamad Hasan and Paul Schliekelman},
  journal= {arXiv preprint arXiv:2203.05926},
  year   = {2022}
}

备注

This work is done under the supervision of Dr. Paul Schliekelman, Associate Professor, Department of Statistics, University of Georgia