中文

解构基于变换器的 amortize 因果发现

机器学习 2026-03-19 v3 机器学习

摘要

监督学习从观察数据中进行因果发现,常常在看似规避传统方法对可识别性所需的显式假设的情况下,即可实现竞争性能。在本文中,我们分析了 CSIvA (Ke 等,2023) 在二维因果模型上的表现,这是一种用于 amortize 推断的变换器架构,旨�在合成数据上训练并迁移到真实数据。首先,我们通过可识别性理论建立了与之之间的鸿沟,发现训练分布在隐式地定义了测试观察数据的因果模型的先验:与经典方法一致,当我们对测试数据拥有良好的先验且底层模型可被识别时,才能实现良好的性能。其次,我们发现 CSIvA 无法泛化到训练期间未见过的因果模型类别:为克服这一限制,我们在理论和实证层面分析了在训练 CSIvA 时,使用多个具有不同结构假设的可识别因果模型生成的数据集,其泛化能力在测试时得到提升。总体而言,我们发现基于变换器的 amortize 因果发现仍遵循可识别性理论,违反了 Lopez-Paz 等人 (2015) 关于监督学习方法可克服其限制的假设。

关键词

引用

@article{arxiv.2405.16924,
  title  = {Demystifying amortized causal discovery with transformers},
  author = {Francesco Montagna and Max Cairney-Leeming and Dhanya Sridhar and Francesco Locatello},
  journal= {arXiv preprint arXiv:2405.16924},
  year   = {2026}
}