因果性与替代变量分析
应用统计
2017-04-04 v1
摘要
基因表达取决于数千个因子,而我们通常只能获得数十或数百个基因表达水平的观测值,这意味着我们处于高维环境中。此外,我们并不总是观察或关注所有因子。然而,许多不同的基因表达水平取决于一组共同因子。通过观察基因表达水平的联合方差以及观测到的主要变量(我们关注的变量),替代变量分析(SVA)旨在估计剩余的未观测因子。最终目标是评估主要变量(或向量)是否对不同基因表达水平具有显著影响,但如果不先估计未观测因子,各种回归模型和假设检验之间就会存在依赖性,这使显著性分析变得复杂。在本研究中,我们定义了一类加性基因表达结构方程模型(SEM),它便于对基因表达数据进行建模,并为理解 SVA 方法的各个步骤提供了有用的框架。我们从建模角度以及因果性角度证明了使用这一类的合理性,具体做法是探索该类的独立性和因果性属性,并与生物学驱动的数据假设进行比较。为此,我们使用了在其他地方发展起来的关于图模型和因果性的理论。然后,我们详细描述了 SVA 方法及其在 R 包 sva 中的实现,并将每一步对应到先前定义的加性基因表达 SEM 的不同部分。
引用
@article{arxiv.1704.00588,
title = {Causality and surrogate variable analysis},
author = {Emiliano Diaz},
journal= {arXiv preprint arXiv:1704.00588},
year = {2017}
}