中文

多组学数据中LASSO与带惩罚因子的整合LASSO(IPF-LASSO)方法的比较:控制第一类错误的变量选择

统计方法学 2024-04-04 v1 应用统计

摘要

与回归建模相关的变量选择已经构成方法论问题超过60年。特别是在高维回归的背景下,开发稳定可靠的变量选择方法、算法和计算工具已成为一个重要研究课题。组学数据是高维数据的一种来源,其特点是多样的基因组层次,额外的分析挑战是如何将这些层次整合到各种类型的分析中。虽然IPF-LASSO模型先前通过为每种模态引入不同的惩罚参数来探索整合多种组学模态进行特征选择和预测,但在控制第一类错误的情况下将异质数据层纳入变量选择的挑战仍然是一个开放问题。为了解决这个问题,我们在IPF-LASSO和常规LASSO中应用稳定性选择作为控制假阳性的变量选择方法。本研究的目的是比较LASSO算法与IPF-LASSO,探究为每种组学模态引入不同的惩罚参数是否能在控制假阳性的同时提高统计功效。研究了两种高维数据结构,一种具有独立数据,另一种具有相关数据。还使用一项乳腺癌治疗研究的数据说明了不同模型,其中IPF-LASSO模型能够选择一些高度相关的临床变量。

关键词

引用

@article{arxiv.2404.02594,
  title  = {Comparison of the LASSO and Integrative LASSO with Penalty Factors (IPF-LASSO) methods for multi-omics data: Variable selection with Type I error control},
  author = {Charlotte Castel and Zhi Zhao and Magne Thoresen},
  journal= {arXiv preprint arXiv:2404.02594},
  year   = {2024}
}

备注

9 pages, 4 figures