当心被模拟的 DAG!因果发现基准可能易被博弈
机器学习
2021-11-11 v3 机器学习
统计方法学
摘要
被模拟的 DAG 模型可能展现出一些或许无意中使其结构可识别并出乎意料地影响结构学习算法的性质。在此,我们表明对于泛型采样的加性噪声模型,边际方差倾向于沿因果序增大。我们引入 varsortability 作为边际方差递增序与因果序之间一致性的度量。对于常见采样的图与模型参数,我们表明某些连续结构学习算法的卓越性能可由高 varsortability 解释,且可被一个简单基线方法匹敌。然而,该性能未必能迁移到真实世界数据,其中 varsortability 可能适中或依赖于度量尺度的选择。在标准化的数据上,同样的算法无法识别出真值 DAG 或其马尔可夫等价类。虽然标准化去除了边际方差中的模式,我们表明产生高 varsortability 的数据生成过程还会留下一种独特的协方差模式,其即使在标准化后也可能被利用。我们的发现对具有独立抽取参数的泛型基准的意义提出了挑战。代码见 https://github.com/Scriddie/Varsortability。
引用
@article{arxiv.2102.13647,
title = {Beware of the Simulated DAG! Causal Discovery Benchmarks May Be Easy To Game},
author = {Alexander G. Reisach and Christof Seiler and Sebastian Weichwald},
journal= {arXiv preprint arXiv:2102.13647},
year = {2021}
}
备注
accepted at the 35th Conference on Neural Information Processing Systems (NeurIPS), 2021; cf. https://openreview.net/forum?id=wEOlVzVhMW_