基于分数匹配的非线性模型因果发现捷径
统计方法学
2023-10-24 v1 机器学习
摘要
由于标注真实数据的稀缺,在因果发现领域使用模拟数据十分普遍。最近,Reisach 等人(2021)指出了模拟线性数据中出现的模式,其在因果方向上表现出边际方差递增。作为实验中的一项消融研究,Montagna 等人(2023)发现非线性模型中分数向量 的方差可能出现类似模式,并引入了 ScoreSort 算法。在本文中,我们正式定义并刻画了非线性加性噪声模型的这种分数可排序(score-sortability)模式。我们发现它定义了一类可识别的(双变量)因果模型,与非线性加性噪声模型有重叠。我们从理论上证明了与先前最先进的基于分数匹配的方法相比,ScoreSort 在统计效率方面的优势,并通过实验展示了文献中最常见的合成基准的分数可排序性。我们的发现表明:(1)数据缺乏多样性是非线性因果发现方法评估中的一个重要局限;(2)在某一问题类内充分测试不同设置的重要性;(3)分析因果发现中统计性质的重要性,该领域研究常局限于定义模型的可识别性条件。
引用
@article{arxiv.2310.14246,
title = {Shortcuts for causal discovery of nonlinear models by score matching},
author = {Francesco Montagna and Nicoletta Noceti and Lorenzo Rosasco and Francesco Locatello},
journal= {arXiv preprint arXiv:2310.14246},
year = {2023}
}