半参数反事实密度估计
统计方法学
2021-02-25 v1 统计理论
统计理论
摘要
因果效应常以均值来刻画,但这可能给出潜在反事实分布的不完整图景。本文考虑估计整个反事实密度及其通用泛函。我们关注两类目标参数。第一类是密度近似,由使用广义距离度量(包含 f-散度以及 范数)向有限维模型的投影所定义。第二类是反事实密度间的距离,其可作为比均值差异更精细的效应度量,以及模型选择工具。我们研究了这些目标的非参数效率界,给出了对平滑但其余通用的模型与距离的结果。重要的是,我们展示了这些界如何联系到特定非平凡反事实函数的均值,从而将密度估计与均值估计问题相联结。进而我们提出针对密度近似与距离的双重稳健式估计量,并研究其收敛速率,表明其在大型非参数模型中可达到最优效率。当存在许多可用且受关注的模型时,我们也给出模型选择与聚合的类似方法。我们的结果对所有通用模型与距离均成立,但通篇我们强调特定选择下的表现,例如线性模型上的 投影,以及指数族上的 KL 投影。最后,我们通过估计 HIV 患者 CD4 计数的密度来例证:若全部接受联合疗法对比仅接受齐多夫定,以及密度效应。结果提示联合疗法可能对高危患者提升 CD4 计数最多。我们的方法已在 GitHub 上免费的 R 包 npcausal 中实现。
引用
@article{arxiv.2102.12034,
title = {Semiparametric counterfactual density estimation},
author = {Edward H. Kennedy and Sivaraman Balakrishnan and Larry Wasserman},
journal= {arXiv preprint arXiv:2102.12034},
year = {2021}
}