中文

结合不完整观测数据与随机化数据以估计异质性处理效应

统计方法学 2024-10-30 v1 机器学习

摘要

来自观察性研究的数据广泛可用且易于获取,但常常包含混杂偏倚。另一方面,来自随机对照试验的数据有助于减少这些偏倚;然而,其收集成本高昂,导致随机化数据规模很小。因此,有效融合观测数据与随机化数据以更好地估计异质性处理效应已获得越来越多的关注。然而,现有整合观测数据与随机化数据的方法必须要求完整的观测数据,即观察性研究中必须同时包含接受处理与未接受处理的受试者。鉴于在观察性研究中纳入所有受试者(无论是否接受处理)并非总能实现,这一先决条件将此类方法的适用性限制在非常特定的情境下。在本文中,我们提出了一种具有弹性的方法,用于结合不完全观测数据和随机化数据以进行异质性处理效应估计,我们将其简称为 CIO。无论观测数据完整与否(完全或部分),CIO 都能有效估计异质性处理效应。具体而言,首先利用来自观察性研究的伪实验组与来自随机对照试验的伪对照组,通过效应估计程序导出一个混杂偏倚函数。随后,在结合可用观测数据与所有随机化数据进行异质性处理效应估计时,该函数被用作校正残差,以修正观测数据的观测结果。为验证我们的方法,我们在一个合成数据集和两个半合成数据集上进行了实验。

关键词

引用

@article{arxiv.2410.21343,
  title  = {Combining Incomplete Observational and Randomized Data for Heterogeneous Treatment Effects},
  author = {Dong Yao and Caizhi Tang and Qing Cui and Longfei Li},
  journal= {arXiv preprint arXiv:2410.21343},
  year   = {2024}
}

备注

10 pages, 4 figures, Accepted By CIKM2024