用于异质处理效应机器学习估计的样本交叉拟合与平均
统计方法学
2020-08-27 v2
摘要
我们研究了样本分割、交叉拟合与平均在条件平均处理效应估计中的有限样本表现。近期提出的方法,即所谓的元学习器(meta-learners),利用机器学习估计不同的干扰函数,从而允许对数据底层结构施加较少限制。为限制使用机器学习方法可能导致的潜在过拟合偏差,已提出交叉拟合估计量。这包括将数据分割为不同折以减少偏差,并对各折取平均以恢复效率。据我们所知,数据应怎样精确分割与平均尚不清楚。我们采用具有不同数据生成过程的蒙特卡洛研究,并考虑十二种在样本分割、交叉拟合与平均过程上不同的估计量。我们在四种不同的元学习器上独立考察各估计量的表现:双重稳健学习器、R-学习器、T-学习器和 X-学习器。我们发现所有元学习器的表现严重依赖于分割与平均的过程。在样本分割估计量中,应用交叉拟合并对多次不同样本分割迭代取中位数可在均方误差(MSE)意义上取得最佳表现。某些元学习器在机器学习方法中包含 lasso 时表现出高方差。排除 lasso 可降低方差并带来稳健且至少具竞争力的结果。
引用
@article{arxiv.2007.02852,
title = {Cross-Fitting and Averaging for Machine Learning Estimation of Heterogeneous Treatment Effects},
author = {Daniel Jacob},
journal= {arXiv preprint arXiv:2007.02852},
year = {2020}
}