中文

基于密度比的双变量连续-离散数据因果发现

机器学习 2026-02-27 v4 机器学习

摘要

我们解决从观测数据推断连续变量 XX 与离散变量 YY 之间因果方向的问题。对于模型 XYX \to Y,我们采用先前工作中使用的阈值模型。对于模型 YXY \to X,我们考虑两种情况:(1) 给定 YY 不同取值的 XX 的条件分布形成位置偏移族;(2)它们是具有独立参数化组成部分的广义正态分布混合物。我们通过三个理论结果建立了因果方向的可识别性。首先,我们证明在 XYX \to Y 时,YY 不同取值下 XX 的条件密度比是单调的。其次,我们建立在 YXY \to X 且条件分布非位置偏移情况下,密度比的单调性仅在参数空间中 Lebesgue 测度为零的集合上成立。第三,我们表明在 XYX \to Y 时,条件分布形成位置偏移族需要因果机制与输入分布之间精确的协调,这在独立机制原则下是非普适的。综上,这些结果表明,密度比的单调性特征化 XYX \to Y 的方向,而非单调性或位置偏移条件特征化 YXY \to X 的方向。基于此,我们提出密度比基于因果发现方法(DRCD),通过测试位置偏移条件和估计密度比的单调性来确定因果方向。在合成和真实数据集上的实验表明,DRCD 在现有方法中表现出优势。

关键词

引用

@article{arxiv.2505.08371,
  title  = {Density Ratio-based Causal Discovery from Bivariate Continuous-Discrete Data},
  author = {Takashi Nicholas Maeda and Shohei Shimizu and Hidetoshi Matsui},
  journal= {arXiv preprint arXiv:2505.08371},
  year   = {2026}
}