组稀疏SVD模型及其在生物数据中的应用
机器学习
2018-07-31 v1 机器学习
定量方法
摘要
稀疏奇异值分解(SVD)模型已被提出用于对高维基因表达数据进行双聚类,以识别具有相似表达的块模式。然而,这些模型在变量选择时未考虑先验组效应。为此,我们首先针对变量的非重叠组结构,提出带有组Lasso(GL1-SVD)和组L0范数惩罚(GL0-SVD)的组稀疏SVD模型。但此类组稀疏SVD模型在某些具有重叠结构的问题中适用性受限。因此,我们还提出两种带有重叠组Lasso(OGL1-SVD)和重叠组L0范数惩罚(OGL0-SVD)的组稀疏SVD模型。我们首先采用交替迭代策略,基于块坐标下降法求解GL1-SVD,并基于投影法求解GL0-SVD。求解OGL1-SVD的关键在于带有重叠组Lasso惩罚的近端算子。我们采用交替方向乘子法(ADMM)求解该近端算子。类似地,我们开发了近似方法求解OGL0-SVD。利用模拟数据对这些方法的应用及与竞争方法的比较证明了其有效性。它们在多个带有基因先验组知识的真实基因表达数据上的广泛应用,识别出了一些具有生物学可解释性的基因模块。
引用
@article{arxiv.1807.10956,
title = {Group-sparse SVD Models and Their Applications in Biological Data},
author = {Wenwen Min and Juan Liu and Shihua Zhang},
journal= {arXiv preprint arXiv:1807.10956},
year = {2018}
}
备注
14 pages, 4 figures