从图模型残差中识别潜变量
机器学习
2021-01-08 v1 机器学习
定量方法
摘要
基于图的因果发现方法旨在捕获与观测数据一致的条件独立性,并区分因果关系与间接或诱导关系。成功构建数据的图模型依赖于因果充分性假设:即所有混杂变量均被测量。当该假设不满足时,所学图结构可能任意错误,且此类模型所隐含的效应可能被错误归因、具有错误量级或误表相关方向。图模型在日益缺乏筛选的“大数据”上的广泛应用,使未观测混杂变量问题重新受到关注。我们提出一种新方法,旨在通过从推断模型的残差中迭代导出潜空间代理变量,在估计 DAG 时控制潜空间。在温和假设下,我们的方法改善了高斯图模型的结构推断并增强了因果效应的可识别性。此外,当模型用于预测结果时,它解除结果父节点上系数的混杂,并在样本外机制与训练数据差异很大时带来改进的预测性能。我们证明,与混杂模型相比,任何结果预测的改进本质上存在上限且不能超出某一极限。我们将方法从 GGM 推广至有序变量与非线性情形。我们的 R 包提供了该方法的 PCA 与自编码器实现,适用于具有一定保证的 GGM,以及在一般情形下无此类保证但性能更优的情况。
引用
@article{arxiv.2101.02332,
title = {Identification of Latent Variables From Graphical Model Residuals},
author = {Boris Hayete and Fred Gruber and Anna Decker and Raymond Yan},
journal= {arXiv preprint arXiv:2101.02332},
year = {2021}
}