中文

自动选择未测量混杂因子的代理变量

机器学习 2024-05-28 v1 统计方法学

摘要

近年来,针对从观察数据中推断未测混杂因子影响下的因果效应,越来越多关注使用代理变量。实际应用中的一个难点在于寻找有效的代理变量。这些代理变量通常依赖背景知识。本文我们在线性因果模型中,针对存在多个未测混杂因子且无代理变量有效性先验知识的情形,研究如何估计单一结果上的多个处理的因果效应。具体而言,我们首先将原本针对单一未测混杂因子的代理变量估计方法扩展至多个未测混杂因子情形。随后,我们基于数据的二阶统计量和高阶统计量,分别提出两种精确的代理变量选择可识别性条件。此外,我们提出两种数据驱动的方法,用于选择代理变量并对因果效应进行无偏估计。理论分析表明我们所提算法的正确性。实验结果在合成数据和真实数据上均显示所提方法的有效性。

关键词

引用

@article{arxiv.2405.16130,
  title  = {Automating the Selection of Proxy Variables of Unmeasured Confounders},
  author = {Feng Xie and Zhengming Chen and Shanshan Luo and Wang Miao and Ruichu Cai and Zhi Geng},
  journal= {arXiv preprint arXiv:2405.16130},
  year   = {2024}
}