一种用于分析 LC-MS 代谢组学数据的多变量变量选择方法
应用统计
2017-04-04 v1
摘要
组学数据的特点是存在强依赖结构,这些结构源于数据采集或某些潜在的生物学过程。例如,在代谢组学中,液相色谱-质谱联用 (LC-MS) ——一种能够广泛覆盖代谢物的技术——产生的数据就表现出这种模式。这些数据集通常用于寻找表征与样本相关目标表型的代谢物。然而,应用某些在变量选择步骤中未针对依赖模式进行调整的统计方法,可能会导致检验效能的损失和虚假变量的选择。本文的目标是在多变量线性模型中提出一种变量选择方法,该方法考虑了多输出的依赖结构,从而可能在 LC-MS 框架下选择出更相关的代谢物。我们在广义线性模型的多变量框架中提出了一种基于 Lasso 的新方法,通过对残差协方差矩阵进行各种建模来考虑依赖结构。我们的数值实验表明,在 Lasso 准则中加入残差协方差矩阵的估计可显著改善变量选择性能。我们的方法还成功应用于由非洲柯巴脂样本组成的 LC-MS 数据集,该方法能够提供一份简短的代谢物列表而不影响表型区分。我们的方法已在 R 包 MultiVarSel 中实现,可从 CRAN (Comprehensive R Archive Network) 获取。
引用
@article{arxiv.1704.00076,
title = {A multivariate variable selection approach for analyzing LC-MS metabolomics data},
author = {M. Perrot-Dockès and C. Lévy-Leduc and J. Chiquet and L. Sansonnet and M. Brégère and M. -P. Étienne and S. Robin and G. Genta-Jouve},
journal= {arXiv preprint arXiv:1704.00076},
year = {2017}
}