中文

面向EHR中缺失资格标准的点暴露稳健因果推断

统计方法学 2026-05-08 v3 应用统计

摘要

在电子健康记录(EHR)中基于研究 eligibility 标准的变量缺失情况,常被忽视。通常情况下,缺乏完整 eligibility 信息的患者会被排除在分析之外,而研究者往往未考虑所隐含的假设,从而可能导致选择偏差。为增加可纳入的患者,研究者可能需追溯至研究基线前的更早时间点,若使用已过时的 eligibility 定义协变量,可能不慎纳入那些在基线时并不符合 eligibility 条件的个体。迄今为止,鲜有工作旨在缓解此类问题。我们提出一种稳健且高效的估计方法,用于推估在 study eligible 人群中定义的因平均处理效应(ATT)。该方法允许在协变量缺失随机(MAR)情形下,使用灵活的机器学习策略来估计 nuisance 函数,同时保持适当的收敛速度,以实现有效的渐近推断。该方法直接由Kaiser Permanente的EHR数据所激发,并用于分析两种常见的脂肪手术干预在长期体重和血糖结果上的差异,针对的是严重肥胖且伴有2型糖尿病患者的队列研究。

关键词

引用

@article{arxiv.2504.16230,
  title  = {Robust Causal Inference for EHR-based Studies of Point Exposures with Missingness in Eligibility Criteria},
  author = {Luke Benz and Rajarshi Mukherjee and Rui Wang and David Arterburn and Heidi Fischer and Catherine Lee and Susan M. Shortreed and Sebastien Haneuse and Alexander W. Levis},
  journal= {arXiv preprint arXiv:2504.16230},
  year   = {2026}
}