中文

基于结果不变数据增强的因果效应估计分析

机器学习 2026-02-02 v2 机器学习

摘要

数据增强(DA)技术常用于机器学习中,以正则化目的更好地在独立同分布(i.i.d.)设置下实现泛化。在本工作中,我们提出了一个统一的框架,将其与因果推断话题结合,为在 i.i.d. 设置之外用于跨干预泛化而论证使用 DA 的必要性。具体而言,我们认为当结果生成机制对我们的 DA 选择保持不变时,这些增强可有效地被视为对处理生成机制本身的干预。这有助于减少由隐藏混杂变量引起的因果效应估计偏差。面对此类隐藏混杂,我们通常使用工具变量(IV)——与结果条件独立的处理随机化来源。然而,IV 在许多应用中并不像 DA 那样易得,这就是本工作的主要动机。通过对 IV 基于估计器的适当正则化,我们引入了 IV-like(IVL)回归的概念,以缓解混杂偏差并提高跨干预的预测性能,即使某些 IV 属性被放宽。最后,我们将参数化 DA 作为 IVL 回归问题加以阐述,并表明其组合可模拟此类 DA 的最差应用,从而进一步提高因果估计和泛化任务的性能,这超出了简单 DA 所能提供的效果。我们在总体情况下进行理论证明,并通过简单线性示例的有限样本情形进行仿真实验。我们还呈现了真实数据的实验,以支持我们的论点。

关键词

引用

@article{arxiv.2510.25128,
  title  = {An Analysis of Causal Effect Estimation using Outcome Invariant Data Augmentation},
  author = {Uzair Akbar and Niki Kilbertus and Hao Shen and Krikamol Muandet and Bo Dai},
  journal= {arXiv preprint arXiv:2510.25128},
  year   = {2026}
}

备注

Accepted at NeurIPS 2025