SNeCT:用于整合多平台数据分析的可扩展网络约束 Tucker 分解
机器学习
2017-11-28 v2 定量方法
机器学习
摘要
动机:我们如何对高维且稀疏的大规模多平台基因组数据进行整合分析?此外,我们如何在分析中系统地融入先验知识,例如基因之间的关联?方法:为解决该问题,我们提出一种可扩展的网络约束 Tucker 分解方法,称之为 SNeCT。SNeCT 在所提出的可并行化网络约束优化函数上采用并行随机梯度下降方法。SNeCT 分解被应用于由大规模多平台多队列癌症数据 PanCan12 构建的张量,并约束于从 PathwayCommons 数据库构建的网络。结果:分解得到的因子矩阵被用于癌症分层、搜索 top-k 相似患者,并展示这些矩阵如何用于个性化解释。在分层测试中,合并的十二队列数据被聚类形成十三个亚类。除其他有趣观察外,这十三个亚类与组织起源高度相关,例如 OV 癌症清晰分为两组,以及在 BRCA 和 UCEC 队列中形成的亚簇内具有高临床相关性。在 top-k 搜索中,生成新患者的基因组谱并基于因子矩阵在已有患者中进行搜索。对于 23 个临床特征,top-k 患者与查询的相似性较高,包括 BRCA 患者的雌激素/孕激素受体状态,其平均精度值分别在 0.72 到 0.86 和 0.68 到 0.86 之间。我们还提供了因子矩阵如何用于每位患者可解释的个性化分析的示例。
引用
@article{arxiv.1711.08095,
title = {SNeCT: Scalable network constrained Tucker decomposition for integrative multi-platform data analysis},
author = {Dongjin Choi and Lee Sael},
journal= {arXiv preprint arXiv:1711.08095},
year = {2017}
}
备注
8 pages