中文

基于NML编码在离散、混合及连续变量中检测未观测共同原因

机器学习 2024-03-12 v1 信息论 机器学习 math.IT

摘要

在存在未观测共同原因的情况下,仅从观测数据中进行因果发现是一个关键且具挑战性的问题。我们将两个随机变量之间所有可能的因果关系划分为以下四个类别,并旨在从观测数据中识别出其中之一:存在任一直接因果关系的两种情况、变量相互独立的情况,以及变量受潜在混杂因素影响的情况。尽管已有方法被提出以解决此问题,但它们要求未观测变量满足关于其方程模型形式的假设。在我们之前的研究(Kobayashi et al., 2022)中,针对离散数据提出了首个无需此类假设的因果发现方法,命名为CLOUD。CLOUD使用归一化最大似然(NML)编码,从一组候选模型中选择能产生观测数据最短编码长度的模型。本文将CLOUD扩展以适用于离散、混合及连续等多种数据类型。我们不仅进行了理论分析以证明CLOUD在模型选择方面的一致性,还通过对合成数据和真实世界数据的大量实验,证明了CLOUD在推断因果关系方面比现有方法更有效。

关键词

引用

@article{arxiv.2403.06499,
  title  = {Detection of Unobserved Common Causes based on NML Code in Discrete, Mixed, and Continuous Variables},
  author = {Masatoshi Kobayashi and Kohei Miyagichi and Shin Matsushima},
  journal= {arXiv preprint arXiv:2403.06499},
  year   = {2024}
}

备注

submitted to Journal of Data Mining and Knowledge Discovery