中文

多变量与混合类型数据的因果推断

机器学习 2017-10-17 v2 机器学习

摘要

给定关于两个随机变量XXYY联合分布的数据,我们考虑推断XXYY之间最可能因果方向的问题。具体而言,我们考虑XXYY可能均为单变量或多变量,且数据类型相同或混合的一般情况。我们采用基于Kolmogorov复杂度的信息论方法,由此可知,先描述关于原因的数据,再描述给定原因下效应的数据,其总描述长度短于相反方向。理想分数是不可计算的,但可以通过最小描述长度(MDL)原理进行近似。基于MDL,我们提出了两种分数,一种适用于XXYY均为相同单一数据类型的情况,另一种适用于它们为混合类型的情况。我们使用分类与回归树对XXYY之间的依赖关系进行建模。由于推断最优模型是NP-hard问题,我们提出了Crack,一种快速贪心算法,可直接从数据中确定最可能的因果方向。在广泛数据集上的实证评估表明,Crack能够可靠且高精度地推断出单变量与多变量因果对在单一与混合类型数据上的正确因果方向。

关键词

引用

@article{arxiv.1702.06385,
  title  = {Causal Inference on Multivariate and Mixed-Type Data},
  author = {Alexander Marx and Jilles Vreeken},
  journal= {arXiv preprint arXiv:1702.06385},
  year   = {2017}
}

备注

9 pages, submitted to sdm