中文

多组学数据集的稀疏整合聚类

应用统计 2013-04-22 v1

摘要

高分辨率微阵列和第二代测序平台是研究与疾病相关的全基因组 DNA 拷贝数、甲基化和基因表达改变的强大工具。整合基因组分析方案在同一组生物学样本中同时测量多种组学数据类型。这种方法提供了任何单一数据类型无法达到的整合数据分辨率。在本研究中,我们使用带惩罚的潜变量回归方法对多种组学数据类型进行联合建模,以识别可用于将患者样本聚类为具有生物学和临床相关性的疾病亚型的公共潜变量。我们考虑 lasso [J. Roy. Statist. Soc. Ser. B 58 (1996) 267-288]、elastic net [J. R. Stat. Soc. Ser. B Stat. Methodol. 67 (2005) 301-320] 和 fused lasso [J. R. Stat. Soc. Ser. B Stat. Methodol. 67 (2005) 91-108] 方法在系数向量中引入稀疏性,揭示对潜变量有显著贡献的重要基因组特征。使用迭代岭回归计算稀疏系数向量。在模型选择中,使用均匀设计 [Monographs on Statistics and Applied Probability (1994) Chapman & Hall] 寻找均匀散布在搜索域中的“实验”点,以高效采样调参组合。我们使用真实和模拟数据集将我们的方法与稀疏奇异值分解(SVD)和带惩罚的高斯混合模型(GMM)进行了比较。所提出的方法被应用于整合乳腺癌和肺癌数据集中的基因组、表观基因组和转录组数据以进行亚型分析。

关键词

引用

@article{arxiv.1304.5401,
  title  = {Sparse integrative clustering of multiple omics data sets},
  author = {Ronglai Shen and Sijian Wang and Qianxing Mo},
  journal= {arXiv preprint arXiv:1304.5401},
  year   = {2013}
}

备注

Published in at http://dx.doi.org/10.1214/12-AOAS578 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)