在变量远多于观测的数据中寻找外生变量
机器学习
2011-04-08 v2
摘要
许多统计方法已被提出用于在变量少于观测的经典情形(p<n,p:变量数,n:观测数)中估计因果模型。然而,包括基因表达数据在内的现代数据集需要在变量数量比观测数量高出几个数量级的挑战性情形(p>>n)中进行高维因果建模。在本文中,我们提出了一种在线性非高斯因果模型中寻找外生变量的方法,该方法所需的样本量远小于传统方法,并且即使在p>>n时也能工作。关键思想是基于非高斯性识别哪些变量是外生的,而不是估计模型的整个结构。外生变量作为触发因果链的触发器,其识别有助于更高效的实验设计和更好地理解因果机制。我们通过人工数据和真实世界基因表达数据的实验来评估该方法。
引用
@article{arxiv.0904.0838,
title = {Finding Exogenous Variables in Data with Many More Variables than Observations},
author = {Shohei Shimizu and Takashi Washio and Aapo Hyvarinen and Seiya Imoto},
journal= {arXiv preprint arXiv:0904.0838},
year = {2011}
}
备注
A revised version of this was published in Proc. ICANN2010