中文

关于机器学习估计的因果参数名义置信区间覆盖率的近无假设检验

机器学习 2020-07-14 v2 机器学习 统计理论 统计方法学 统计理论

摘要

对于许多感兴趣的因果效应参数,双重稳健机器学习(DRML)估计量 ψ^1\hat{\psi}_{1} 是最先进的,它结合了机器学习的良好预测性能、双重稳健估计量的偏差减小,以及样本分割与交叉拟合的分析可处理性与偏差缩减。尽管如此,即使在没有未测量因素混杂的情况下,名义 (1α)(1 - \alpha) Wald置信区间 ψ^1±zα/2se^[ψ^1]\hat{\psi}_{1} \pm z_{\alpha / 2} \widehat{\mathsf{se}} [\hat{\psi}_{1}] 在 large samples 中仍可能欠覆盖,因为 ψ^1\hat{\psi}_{1} 的偏差可能与其 n1/2n^{-1/2} 阶标准误同阶甚至更大。在本文中,我们引入本质上无假设的检验,其(i)可证伪 ψ^1\hat{\psi}_{1} 偏差小于其标准误阶的零假设,(ii)可对Wald区间的真实覆盖率提供上置信界,(iii)在零假设下对 nuisance parameters 无光滑性/稀疏性假设时仍有效。这些我们称之为下划线{A}ssumption下划线{F}ree下划线{E}mpirical下划线{C}overage下划线{T}ests(AFECTs)的检验,基于一个估计 ψ^1\hat{\psi}_{1} 部分偏差的U-统计量。

关键词

引用

@article{arxiv.1904.04276,
  title  = {On nearly assumption-free tests of nominal confidence interval coverage for causal parameters estimated by machine learning},
  author = {Lin Liu and Rajarshi Mukherjee and James M. Robins},
  journal= {arXiv preprint arXiv:1904.04276},
  year   = {2020}
}

备注

Significant updates from the previous version. In press in Statistical Science