中文

估计弥漫性大 B 细胞淋巴瘤基因表达数据集网络荟萃分析的共同协方差矩阵

机器学习 2017-08-23 v3 基因组学 统计方法学

摘要

基因表达协方差矩阵的估计在癌症系统生物学中有许多应用。然而,许多基因表达研究受限于样本量小,因此通过跨研究收集基因表达数据来增加样本量变得流行起来。受传统使用随机效应模型的荟萃分析的启发,我们提出了一种层次随机协方差模型,并将其用于跨 11 项大规模弥漫性大 B 细胞淋巴瘤(DLBCL)基因表达研究的基因相关网络的荟萃分析。我们建议使用最大似然估计量来估计潜在的公共协方差矩阵,并引入了一种 EM 算法进行估计。通过模拟实验,利用共表型相关性和 Kullback-Leibler 散度比较估计的协方差矩阵,结果表明所提出的估计量表现优于或不差于简单的合并估计量。在对 DLBCL 数据估计的共同协方差矩阵的事后分析中,我们能够识别出具有预后价值的特征基因所构成的新颖且具有生物学意义的基因相关网络。总之,当测量多个特征并认为它们共享一个被研究依赖性噪声掩盖的共同协方差矩阵时,该方法似乎提供了一个普遍适用的荟萃分析框架。

关键词

引用

@article{arxiv.1503.07990,
  title  = {Estimating a common covariance matrix for network meta-analysis of gene expression datasets in diffuse large B-cell lymphoma},
  author = {Anders Ellern Bilgrau and Rasmus Froberg Brøndum and Poul Svante Eriksen and Karen Dybkær and Martin Bøgsted},
  journal= {arXiv preprint arXiv:1503.07990},
  year   = {2017}
}

备注

18 pages, 4 figures