利用缺失类型改进部分识别及其在马拉维 HIV 感染率研究中的应用
统计方法学
2018-09-12 v6
摘要
实证研究经常受到数据缺失的困扰。当数据为非随机缺失时,感兴趣的参数通常不可识别。在没有额外假设的情况下,我们可以推导出感兴趣参数的界限,但不幸的是,这些界限往往过宽而缺乏信息量。因此,利用额外信息来收紧这些最坏情况界限至关重要。传统的缺失数据分析仅使用二元缺失数据指示符的信息,即某个数据点要么缺失,要么未缺失。然而,真实数据往往提供比二元缺失数据指示符更多的信息,它们常常记录不同类型的缺失。在一项具有启发性的 HIV 状况调查中,数据缺失可能是由于受访者不愿回答调查项目或因住院而无法参与访问,也可能是由于受访者暂时不在或搬迁。显然,某些缺失类型更可能为非随机缺失,而另一些缺失类型则更可能为随机缺失。我们证明,充分利用缺失类型可以得到更窄的感兴趣参数界限。在一个真实案例中,我们展示了在估计马拉维农村地区 HIV 感染率时,界限宽度减少了 50% 以上的实质性改进。正如我们通过 HIV 研究所说明的,我们的策略也可用于通过逐步增加或减少被视为随机缺失的类型集合来进行敏感性分析。此外,我们提出了一种易于实施的方法,用于为界限表示为有限参数的最小值和最大值的部分识别参数构建置信区间,这不仅适用于我们的问题,也适用于许多其他涉及界限的问题。
引用
@article{arxiv.1610.01198,
title = {Using Missing Types to Improve Partial Identification with Application to a Study of HIV Prevalence in Malawi},
author = {Zhichao Jiang and Peng Ding},
journal= {arXiv preprint arXiv:1610.01198},
year = {2018}
}