中文

基于正-未标记学习的观察性因果推断中的控制组构建

机器学习 2025-07-22 v1

摘要

在因果推断中,无论是通过随机对照试验还是观察性研究,获取treated与control单位都是估计特定处理对感兴趣结果影响的关键。当处理分配为随机时,可直接通过比较两组之间的结果来估计平均处理效应(ATE)。在非随机情境下,各类技术被用于调整混杂因素,以近似反事实情景以恢复无偏的ATE。一个常见挑战,尤其在观察性研究中,就是缺乏明确标注为control的单位——即已知未接受处理的单位。为此,我们提出正-未标记(PU)学习框架,仅凭可用treated(正)单位,从未标记单位池中以高置信度识别control单位。我们使用both模拟数据和真实数据进行评估。我们构建包含多样化关系的因果图,并据此在various情景下生成合成数据,评估该方法可靠性,以恢复允许估计真实ATE的控制组。我们还将方法应用于真实数据,涉及可持续农业中的最佳播种与肥料处理。我们的发现表明,PU学习能够仅凭treated单位从未标记数据中成功识别出control(负)单位,并通过所得控制组估计的ATE与真实值高度接近。该工作在观察性因果推断中具有重要意义,尤其在随机实验难以或昂贵的领域。 在地球科学、环境科学和农业科学等领域,它使得通过利用可得的地球观测和气候数据,尤其是在treatment单位可用而control单位缺乏的情况下,实现大量准实验。

关键词

引用

@article{arxiv.2507.14528,
  title  = {Positive-Unlabeled Learning for Control Group Construction in Observational Causal Inference},
  author = {Ilias Tsoumas and Dimitrios Bormpoudakis and Vasileios Sitokonstantinou and Athanasios Askitopoulos and Andreas Kalogeras and Charalampos Kontoes and Ioannis Athanasiadis},
  journal= {arXiv preprint arXiv:2507.14528},
  year   = {2025}
}

备注

Accepted at KDD 2025 Workshop on Causal Inference and Machine Learning in Practice