将调节统计量推广至高维生物学中的数据自适应半参数估计
统计方法学
2023-03-10 v4
摘要
高维生物数据的广泛可用性使得对许多生物学特征进行同时筛选成为计算生物学及相关科学的核心问题。虽然此类数据集的维度持续增长,但在测量基线混杂因素的健康研究中,从暴露模式中识别生物标志物的复杂性同样在增加;此外,在避免模型误设的同时做到这一点,仍是一个仅得到部分解决的问题。能够结合灵活的、数据自适应的回归技术来估计数据生成分布的相关成分的高效估计量,为避免模型误设提供了一条途径;然而,在需要同时估计众多参数的高维问题背景下,标准方差估计量已被证明是不稳定的,即使在标准多重检验校正下也会导致不可靠的第一类错误控制。我们提出了一种通用方法,将经验贝叶斯收缩应用于一族总体干预因果效应的高效、渐近线性估计量的方差估计量。我们对基于收缩的方差估计量的推广提高了高维环境中的推断稳定性,促进了这些估计量在样本量有限的高维生物数据集中的应用,以推导非参数变量重要性度量。其结果是一种数据自适应方法,能够在样本有限的研究中稳健地揭示高维数据中稳定的因果关联。我们在数值实验中将广义方差估计量与其他方差估计量进行了比较评估。在一项关于吸烟表观遗传学效应的观察性研究的高维 DNA 甲基化数据分析中,展示了利用所提方法识别生物标志物的过程。
引用
@article{arxiv.1710.05451,
title = {A generalization of moderated statistics to data adaptive semiparametric estimation in high-dimensional biology},
author = {Nima S. Hejazi and Philippe Boileau and Mark J. van der Laan and Alan E. Hubbard},
journal= {arXiv preprint arXiv:1710.05451},
year = {2023}
}