中文

零膨胀作为缺失数据问题:一种基于代理的方法

统计方法学 2024-07-03 v2 人工智能

摘要

一种常见的零膨胀数据类型是,由于数据记录惯例(假设罕见结果不存在)或数据记录设备的细节(例如基因表达数据中的人为零),某些真实值被错误地替换为零。现有的零膨胀数据方法要么通过显式表示多余零的参数混合模型来拟合观测数据似然,要么旨在用插补值替换多余零。如果分析的目标依赖于知道真实的数据实现,零膨胀数据的一个特殊挑战是可识别性,因为很难正确确定哪些观测到的零是真实的,哪些是膨胀的。本文将零膨胀数据视为一种一般类型的缺失数据问题,其中每当记录到零时,潜在删失变量的可观测性指标本身是未观测到的。我们表明,在没有额外假设的情况下,涉及零膨胀变量的目标参数无法识别。然而,如果观测到缺失性指标的代理变量,则Kuroki和Pearl的效果恢复方法的修改版本允许在已知代理-指标关系的情况下进行识别和估计。如果这种关系未知,我们的方法为敏感性分析提供了一种部分识别策略。具体来说,我们表明只有某些代理-指标关系与观测数据分布兼容。我们给出了在分类结果情况下这种关系的解析界限,该界限在某些模型中是紧的。对于更复杂的情况,可以使用Duarte等人[2023]的方法计算紧的数值界限。我们通过模拟研究和关于中心导管相关血流感染的数据应用来说明我们的方法。

关键词

引用

@article{arxiv.2406.00549,
  title  = {Zero Inflation as a Missing Data Problem: a Proxy-based Approach},
  author = {Trung Phung and Jaron J. R. Lee and Opeyemi Oladapo-Shittu and Eili Y. Klein and Ayse Pinar Gurses and Susan M. Hannum and Kimberly Weems and Jill A. Marsteller and Sara E. Cosgrove and Sara C. Keller and Ilya Shpitser},
  journal= {arXiv preprint arXiv:2406.00549},
  year   = {2024}
}

备注

28 pages, 8 figues, accepted for the 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024)