LOOP 估计量:随机实验中针对协变量的调整方法
应用统计
2017-08-04 v1
摘要
在进行随机对照试验时,通常需要预先指定用于分析数据的统计方法。这些分析通常涉及对基线协变量的微小不平衡进行调整。然而,这带来了一个两难问题:调整过多的协变量可能弊大于利,损害精度,而且在实验前往往不清楚哪些协变量能预测结果。例如,如果使用过多协变量,事后分层和普通最小二乘(OLS)回归调整实际上都可能增加方差(相对于简单的均值差)。在 Neyman-Rubin 模型下,OLS 也存在偏差。本文中,我们引入了平均处理效应的 LOOP(“留一潜在结果”)估计量。我们逐一留出每个观测值,然后使用预测算法(如随机森林)来插补该观测值的处理潜在结果和对照潜在结果。该估计量在 Neyman-Rubin 模型下是无偏的,其表现通常至少与未调整估计量一样好,并且实验随机化在很大程度上为其统计假设提供了依据。重要的是,LOOP 估计量还使我们能够在使用随机森林时利用自动变量选择的优势。
引用
@article{arxiv.1708.01229,
title = {The LOOP Estimator: Adjusting for Covariates in Randomized Experiments},
author = {Edward Wu and Johann Gagnon-Bartsch},
journal= {arXiv preprint arXiv:1708.01229},
year = {2017}
}