关于机器学习估计的因果参数名义置信区间覆盖率的近无假设检验
机器学习
2020-07-14 v2 机器学习
统计理论
统计方法学
统计理论
摘要
对于许多感兴趣的因果效应参数,双重稳健机器学习(DRML)估计量 是最先进的,它结合了机器学习的良好预测性能、双重稳健估计量的偏差减小,以及样本分割与交叉拟合的分析可处理性与偏差缩减。尽管如此,即使在没有未测量因素混杂的情况下,名义 Wald置信区间 在 large samples 中仍可能欠覆盖,因为 的偏差可能与其 阶标准误同阶甚至更大。在本文中,我们引入本质上无假设的检验,其(i)可证伪 偏差小于其标准误阶的零假设,(ii)可对Wald区间的真实覆盖率提供上置信界,(iii)在零假设下对 nuisance parameters 无光滑性/稀疏性假设时仍有效。这些我们称之为下划线{A}ssumption下划线{F}ree下划线{E}mpirical下划线{C}overage下划线{T}ests(AFECTs)的检验,基于一个估计 部分偏差的U-统计量。
引用
@article{arxiv.1904.04276,
title = {On nearly assumption-free tests of nominal confidence interval coverage for causal parameters estimated by machine learning},
author = {Lin Liu and Rajarshi Mukherjee and James M. Robins},
journal= {arXiv preprint arXiv:1904.04276},
year = {2020}
}
备注
Significant updates from the previous version. In press in Statistical Science