动态基因网络的状态空间建模
应用统计
2013-10-08 v3
摘要
基因组现实是一个高度复杂且动态的系统。高通量技术的最新发展使研究人员能够同时测量大量基因(数量级达数千)的丰度。挑战在于从这些测量数据中解析出基因/蛋白质、基因/基因或蛋白质/蛋白质相互作用以及细胞系统的关键生物学特征。我们的目标是设计一种方法,从高通量数据源(如基因表达微阵列)中推断转录或基因调控网络,该方法需考虑潜在的隐藏状态(如未测量的转录因子 (TFs)),并满足特定的马尔可夫性质。我们提出了一种动态状态空间表示。该方法基于 EM 算法,其中 E 步结合了卡尔曼平滑算法,利用自助法 (bootstrap) 计算置信区间以推断网络,并使用 AIC 进行模型选择。状态空间模型是一种已被证明能有效逆向工程转录网络的方法。所提出的方法应用于从成熟的 T 细胞获得的时间序列微阵列数据。当我们将该方法应用于 T 细胞数据时,得到最优隐藏状态数为 4。我们的结果支持 Jun 基因家族中存在有趣的生物学特性。以下基因主要被视为调控基因:FYB、CCNA2、AKT1、TRAF5、CASP4 和 CTNNB1。我们发现 Jun-B 与 SMN1 之间存在相互作用,且 CDC2 激活 Jun-D。在 4 个假定的转录因子中,我们发现显著的相互作用或一一对应关系较少。就外向边而言的重要关键基因中,我们发现 CCNA2、JUNB、CDC2、CASP4、JUND 等基因具有高度的连通性。R 计算机源代码可在我们的网站 http://www.math.rug.nl/stat/Main/Software 获取。
引用
@article{arxiv.1308.3590,
title = {State-space modeling of dynamic genetic networks},
author = {Anani Lotsi and Ernst Wit},
journal= {arXiv preprint arXiv:1308.3590},
year = {2013}
}