基于白化方法的高维逻辑回归模型变量选择
统计方法学
2022-07-01 v1
摘要
在生物信息学中,测序技术的快速发展使我们能够收集到越来越多的组学数据。基于组学数据的分类是生物医学研究的核心问题之一。然而,组学数据通常样本量有限但特征维度高,并且假定只有少数特征(生物标志物)是活跃的,即对不同类别(例如癌症亚型、治疗应答者/无应答者)具有判别信息。因此,识别用于分类的活跃生物标志物已成为组学数据分析的基础。针对二分类问题,我们提出了一种创新的特征选择方法,旨在处理生物标志物之间的高度相关性。大量研究表明了相关生物标志物的恶劣影响以及准确识别活跃生物标志物的困难。我们的方法 WLogit 包括对设计矩阵进行白化以去除生物标志物之间的相关性,然后使用适用于逻辑回归模型的惩罚准则来选择特征。我们使用多种情景下的合成数据评估了 WLogit 的性能,并与其他方法进行了比较。结果表明,即使在生物标志物高度相关的情况下,WLogit 也能识别几乎所有活跃生物标志物,而其他方法则失败,从而带来了更高的分类准确率。该性能还在两种淋巴瘤亚型的分类上进行了评估,所获得的分类器同样优于其他方法。我们的方法已在 Comprehensive R Archive Network (CRAN) 上提供的 \texttt{WLogit} R 包中实现。
引用
@article{arxiv.2206.14850,
title = {Variable selection in high-dimensional logistic regression models using a whitening approach},
author = {Wencan Zhu and Céline Lévy-Leduc and Nils Ternès},
journal= {arXiv preprint arXiv:2206.14850},
year = {2022}
}