中文

用于多组学数据并应用于心脏代谢综合征的两步惩罚逻辑回归

统计方法学 2020-08-04 v1 应用统计 机器学习

摘要

基于高维多组学数据集构建预测二分类标签的分类模型面临若干挑战,因为各数据层在预测变量数量、数据类型与噪声水平方面通常差异显著。既往研究表明,对这类数据集应用带弹性网络惩罚的经典逻辑回归可能导致较差结果(Liu 等人,2018)。我们实现了一种多组学逻辑回归的两步法:先在各层分别进行变量选择,再利用第一步选出的变量构建预测模型。此处,我们的方法与为同一目的开发的其他方法进行比较,并将现有的多组学线性回归软件(Zhao 与 Zucknick,2020)适配至逻辑回归场景。大量模拟研究表明,若目标是尽可能多地选出相关预测变量,同时取得与最佳竞争方法相当的预测性能,则应优先采用我们的方法。我们的动机案例是一个心脏代谢综合征数据集,包含针对 2 个极端表型组(10 名肥胖者与 10 名脂肪萎缩个体)及 185 名献血者的八类“组学”数据类型。我们提出的方法使我们能够在分子层面识别刻画心脏代谢综合征的特征。R 代码可在 https://github.com/acabassi/logistic-regression-for-multi-omic-data 获取。

关键词

引用

@article{arxiv.2008.00235,
  title  = {Two-step penalised logistic regression for multi-omic data with an application to cardiometabolic syndrome},
  author = {Alessandra Cabassi and Denis Seyres and Mattia Frontini and Paul D. W. Kirk},
  journal= {arXiv preprint arXiv:2008.00235},
  year   = {2020}
}

备注

Manuscript: 22 pages, 6 figures. Supplement: 24 pages, 20 figures. For associated R code, see https://github.com/acabassi/logistic-regression-for-multi-omic-data