中文

基于分数匹配的非线性模型因果发现捷径

统计方法学 2023-10-24 v1 机器学习

摘要

由于标注真实数据的稀缺,在因果发现领域使用模拟数据十分普遍。最近,Reisach 等人(2021)指出了模拟线性数据中出现的模式,其在因果方向上表现出边际方差递增。作为实验中的一项消融研究,Montagna 等人(2023)发现非线性模型中分数向量 logpX\nabla \log p_{\mathbf{X}} 的方差可能出现类似模式,并引入了 ScoreSort 算法。在本文中,我们正式定义并刻画了非线性加性噪声模型的这种分数可排序(score-sortability)模式。我们发现它定义了一类可识别的(双变量)因果模型,与非线性加性噪声模型有重叠。我们从理论上证明了与先前最先进的基于分数匹配的方法相比,ScoreSort 在统计效率方面的优势,并通过实验展示了文献中最常见的合成基准的分数可排序性。我们的发现表明:(1)数据缺乏多样性是非线性因果发现方法评估中的一个重要局限;(2)在某一问题类内充分测试不同设置的重要性;(3)分析因果发现中统计性质的重要性,该领域研究常局限于定义模型的可识别性条件。

关键词

引用

@article{arxiv.2310.14246,
  title  = {Shortcuts for causal discovery of nonlinear models by score matching},
  author = {Francesco Montagna and Nicoletta Noceti and Lorenzo Rosasco and Francesco Locatello},
  journal= {arXiv preprint arXiv:2310.14246},
  year   = {2023}
}