用于在高维数据中构建基于倾向得分估计量的协同控制 LASSO
统计方法学
2017-07-03 v1 统计计算
机器学习
摘要
基于倾向得分 (PS) 的估计量越来越多地用于观察性研究中的因果推断。然而,高维数据中 PS 估计的模型选择受到的关注甚少。在这些设定下,PS 模型的传统选择基于治疗机制本身的拟合优度,而未考虑感兴趣的因果参数。协同最小损失估计 (C-TMLE) 是一种用于因果推断的新方法,它在选择 PS 模型时考虑了关于感兴趣因果参数的信息。这种“协同学习”在选择 PS 模型时考虑了变量与治疗及结果的关联,以最小化估计治疗效应中的偏差 - 方差权衡。在本研究中,我们介绍了一种在高维协变量设定下使用 LASSO 估计量进行 PS 估计时进行协同模型选择的新方法。为了证明协同选择 PS 模型的重要性,我们基于真实的电子医疗数据库设计了准实验,其中仅手动生成潜在结果,而治疗和基线协变量保持不变。结果表明,C-TMLE 算法在点估计和置信区间覆盖率方面均优于其他竞争估计量。此外,由 C-TMLE 选择的 PS 模型可应用于其他基于 PS 的估计量,这也使点估计和置信区间覆盖率得到了实质性改善。我们通过一个实证案例阐述了所讨论的概念,该案例比较了非选择性非甾体抗炎药与选择性 COX-2 抑制剂对 Medicare 受益人群胃肠道并发症的影响。
引用
@article{arxiv.1706.10029,
title = {Collaborative-controlled LASSO for Constructing Propensity Score-based Estimators in High-Dimensional Data},
author = {Cheng Ju and Richard Wyss and Jessica M. Franklin and Sebastian Schneeweiss and Jenny Häggström and Mark J. van der Laan},
journal= {arXiv preprint arXiv:1706.10029},
year = {2017}
}