中文

机制学习:通过因果加权高斯混合模型在存在多个未知混杂的情况下进行反向因果推断

机器学习 2025-11-04 v2 概率论 机器学习

摘要

机器学习(ML)预测模型的一个主要局限在于,它们恢复的是变量之间的关联性而非因果预测关系。在 ML 的高风险自动化应用中,这是有问题的,因为模型通常会学习到虚假的、非因果的关联。本文提出了机制学习,这是一种简单的方法,它使用因果加权高斯混合模型对观测数据进行去混杂,使得任何合适的 ML 模型都能被迫学习效应与其原因之间的预测关系(反向因果推断),尽管可能存在多个未知且未测量的混杂因素。效应变量可以是高维的,且预测关系可以是非线性的,这在 ML 应用中很常见。这种新颖的方法适用性广,唯一的要求是存在一组介导原因(预测目标)与效应(特征数据)的机制变量,且这些机制变量独立于(未测量的)混杂变量。我们在完全合成、半合成和真实世界数据集上测试了我们的方法,证明它可以发现可靠、无偏的因果 ML 预测器;相比之下,在原始观测数据上使用经典监督学习朴素训练的同一 ML 预测器,则受到虚假关联的严重偏差影响。我们在线提供了用于实现本文结果的代码。

关键词

引用

@article{arxiv.2410.20057,
  title  = {Mechanism Learning: reverse causal inference in the presence of multiple unknown confounding through causally weighted Gaussian mixture models},
  author = {Jianqiao Mao and Max A. Little},
  journal= {arXiv preprint arXiv:2410.20057},
  year   = {2025}
}

备注

15 pages, 7 figures