中文

双向关联矩阵的集成分解

机器学习 2020-02-10 v1 机器学习 定量方法 统计方法学

摘要

分子“组学”技术的进步推动了用于整合多源高含量生物医学数据的新方法的发展。然而,大多数用于整合多个数据矩阵的统计方法仅考虑垂直共享的数据(单一队列多平台)或水平共享的数据(不同队列单平台)。这对于呈双向关联矩阵形式(例如,多队列在多平台上测量)的数据而言具有局限性,而这类数据在大规模生物医学研究中越来越常见。本文中,我们提出 BIDIFAC(Bidimensional Integrative Factorization,双向集成分解)用于双向关联数据矩阵的集成降维与信号逼近。我们的方法将数据分解为(i)全局共享、(ii)行共享、(iii)列共享以及(iv)单矩阵结构分量,从而促进对共享和独特变异性模式的探究。对于估计,我们使用扩展单一矩阵核范数惩罚的惩罚目标函数。作为复杂秩选择问题的替代,我们利用随机矩阵理论的结果来选择调谐参数。我们应用我们的方法,使用来自 TCGA 的乳腺癌数据,整合两个基因组学平台(mRNA 和 miRNA 表达)跨越两个样本队列(肿瘤样本和正常组织样本)。我们提供用于拟合 BIDIFAC、填补缺失值和生成模拟数据的 R 代码。

关键词

引用

@article{arxiv.1906.03722,
  title  = {Integrative Factorization of Bidimensionally Linked Matrices},
  author = {Jun Young Park and Eric F. Lock},
  journal= {arXiv preprint arXiv:1906.03722},
  year   = {2020}
}

备注

27 pages, 4 figures