靶向学习的有限样本推断
统计理论
2017-09-01 v1 统计理论
摘要
高度自适应 Lasso (HAL)-TMLE 是统计模型中路径可微参数的有效估计量,它最少(且可能仅)假设真实干扰参数的截面变差范数是有限的。它依赖于干扰参数的初始估计量(HAL-MLE),通过在截面变差范数受常数约束的参数空间上最小化经验风险来获得,其中该常数可以通过交叉验证选择。在 HAL-MLE 的公式中,该截面变差范数对应于指示基系数的绝对值之和。由于其依赖于机器学习,TMLE 的统计推断一直基于其正态极限分布,从而可能在有限样本中忽略了较大的二阶余项。在本文中,我们提出了四种构建有限样本 0.95 置信区间的方法,这些方法使用非参数自助法来估计 HAL-TMLE 的有限样本分布或支配真实有限样本分布的保守分布。我们证明了它能一致地估计最优正态极限分布,而其近似误差由自助法对表现良好的经验过程的性能驱动。我们展示了我们的一般推断方法在以下情况中的应用:1) 基于观察每个单位的协变量向量、二元处理和结果,对平均处理效应进行非参数估计;以及 2) 对数据分布的多变量密度平方的积分进行非参数估计。
引用
@article{arxiv.1708.09502,
title = {Finite Sample Inference for Targeted Learning},
author = {Mark van der Laan},
journal= {arXiv preprint arXiv:1708.09502},
year = {2017}
}