二值与定量数据的广义同步成分分析
统计方法学
2019-06-04 v3
摘要
在当前系统生物学研究时代,需要对测量于相同对象上的二值与定量基因组数据集进行整合分析。探索多个定量数据集中潜在依赖结构的标准工具之一是同步成分分析(SCA)模型。然而,当部分数据为二值时,它没有任何应对措施。为此,我们提出广义 SCA(GSCA)模型,该模型在最大似然框架下考虑了二值与定量测量的不同数学性质。与 SCA 模型类似,假设一个公共低维子空间来表示这两类不同测量之间的共享信息。但是,当使用大于一的秩时,GSCA 模型容易过拟合,导致部分估计参数变得非常大。为获得低秩解并抑制过拟合,我们提出使用核范数惩罚的凹变体。我们开发了高效的优化算法以拟合带有不同凹惩罚的该模型。使用贴近实际的模拟(低信噪比和高度不平衡的二值数据)来评估所提模型在恢复底层结构方面的性能。此外,实现了基于缺失值的交叉验证过程用于模型选择。我们展示了 GSCA 模型对来自 GDSC1000 数据集的定量基因表达与二值拷贝数畸变(CNA)测量进行探索性数据分析的实用性。
引用
@article{arxiv.1807.04982,
title = {Generalized simultaneous component analysis of binary and quantitative data},
author = {Yipeng Song and Johan A. Westerhuis and Nanne Aben and Lodewyk F. A. Wessels and Patrick J. F. Groenen and Age K. Smilde},
journal= {arXiv preprint arXiv:1807.04982},
year = {2019}
}
备注
19 pages, 10 figures