中文

面向真实数据因果效应推断的信息最大化与域无关表示学习

机器学习 2022-02-23 v1 机器学习

摘要

真实数据因果推断的首要挑战是处理由处理选择偏差引起的、不同处理选项间协变量的不平衡。为解决此问题,近期文献基于不同的域散度度量(如 Wasserstein 距离、最大均值差异、位置相关度量和域重叠)探索了域不变表示学习。本文中,我们揭示了这些策略的弱点,即它们在强制域不变性时会导致预测信息丢失,且处理效应估计性能不稳定,严重依赖于域分布特征与域散度度量的选择。受信息论启发,我们提出学习信息最大化与域无关表示以解决上述难题。我们的方法利用全局特征表示与个体特征表示之间的互信息,以及特征表示与处理分配预测之间的互信息,以最大程度捕获处理组与对照组共同的预测信息。此外,我们的方法滤除了工具变量与无关变量的影响,从而有效提升潜在结果的预测能力。在合成与真实数据集上的实验结果表明,我们的方法在因果效应推断上取得了最先进的性能。而且,面对具有不同数据分布特征、复杂变量类型与严重协变量不平衡的数据时,我们的方法展现出可靠的预测性能。

关键词

引用

@article{arxiv.2202.10885,
  title  = {Learning Infomax and Domain-Independent Representations for Causal Effect Inference with Real-World Data},
  author = {Zhixuan Chu and Stephen Rathbun and Sheng Li},
  journal= {arXiv preprint arXiv:2202.10885},
  year   = {2022}
}

备注

SIAM International Conference on Data Mining (SDM22)