中文

针对非随机缺失数据的乘法工具变量模型

统计方法学 2025-09-29 v1

摘要

工具变量(IV)方法为处理非随机缺失的结果数据提供了一种有价值的方法。有效的缺失数据工具是一个测量因子,它预测非响应过程,且在潜在人群中独立于结果。为了实现点识别,所有现有的针对缺失数据的IV方法,包括著名的Heckman选择模型,都先验地限制了结果尺度上选择偏差的程度,因此可能低估了由于数据缺失导致的不确定性。在本工作中,我们引入了一个允许结果尺度上的选择偏差程度保持完全不受限制的IV框架。新方法的识别依赖于一个关键的乘法选择模型,该模型假设工具与选择和结果的任何隐藏共同相关因子在乘法尺度上不发生交互。有趣的是,我们证明了在条件(i)-(iii)下,缺失结果的任何正则统计泛函都可以通过一个单臂Wald比率估计量进行非参数识别,这类似于因果推断中标准的Wald比率估计量。为了进行估计和推断,我们刻画了在观测数据非参数模型上定义的任何泛函的影响函数,并利用它开发了半参数多重稳健IV估计量。我们还考虑了该方法的若干扩展,包括多分类和连续工具这一重要的实际场景。模拟研究展示了所提方法良好的有限样本性能,我们进一步在一项HIV研究中展示了这一点,该研究嵌套于我们在博茨瓦纳Mochudi进行的一项家庭健康调查中,其中访谈员特征被用作工具,以纠正调查研究中HIV部分由于依赖性非响应导致的选择偏差。

关键词

引用

@article{arxiv.2509.22499,
  title  = {A Multiplicative Instrumental Variable Model for Data Missing Not-at-Random},
  author = {Yunshu Zhang and Chan Park and Jiewen Liu and Yonghoon Lee and Mengxin Yu and James M. Robins and Eric J. Tchetgen Tchetgen},
  journal= {arXiv preprint arXiv:2509.22499},
  year   = {2025}
}

备注

14 pages, 3 figures