中文

一种面向高维数据混杂因素选择的有针对性方法

统计方法学 2021-12-17 v1 应用统计

摘要

我们在估计因果效应时,考虑从一组潜在的大量协变量中选择用于调整的混杂因素的问题。近来,高维倾向得分(hdPS)方法被开发用于此任务;hdPS 通过估计每个变量的重要性得分并对潜在混杂因素排序,从而选择排名靠前的若干变量。然而,该排序过程存在局限:它要求所有变量均为二值变量。我们提出将 hdPS 推广至一般类型的响应变量与混杂变量。我们进一步开发了组重要性得分,使我们能够对潜在混杂因素组进行排序。主要挑战在于,我们的参数需要倾向得分模型或响应模型之一;二者均易受模型误设影响。我们提出一种靶向最大似然估计量(TMLE),其允许使用非参数、机器学习工具来拟合这些中间模型。我们建立了该估计量的渐近正态性,从而可据此构造置信区间。我们以针对模拟数据与真实数据的数值研究补充了我们的工作。

关键词

引用

@article{arxiv.2112.08495,
  title  = {A Targeted Approach to Confounder Selection for High-Dimensional Data},
  author = {Asad Haris and Robert Platt},
  journal= {arXiv preprint arXiv:2112.08495},
  year   = {2021}
}