用于大规模回归数据特征选择的子抽样胜者算法
机器学习
2020-02-10 v1 机器学习
摘要
在回归分析中从大量协变量(又称特征)中进行特征选择仍是数据科学中的一项挑战,尤其是在其扩展到不断增长的数据规模并找到一组具有科学意义的特征的潜力方面。例如,为开发卵巢癌新的、有响应的药物靶点,实际特征选择过程的真实错误发现率(FDR)也必须匹配目标 FDR。当真实特征稀疏时,流行的特征选择方法是使用惩罚似然或收缩估计,例如 LASSO、SCAD、Elastic Net 或 MCP 过程(称之为基准过程)。我们提出一种使用新子抽样方法的不同方法,称为子抽样胜者算法(SWA)。SWA 的核心思想类似于美国全国优学奖学者选拔所用的方法。SWA 使用“基础过程”分析每个子样本,根据所有子样本分析中每个特征的表现计算所有特征的得分,基于所得得分获得“半决赛入围者”,然后确定“决赛入围者”,即最重要的特征。由于其子抽样性质,SWA 原则上可扩展到任意维度的数据。与基准过程和 randomForest 相比,SWA 还具有最佳控制的真实 FDR,同时具有有竞争力的真特征发现率。我们还提出了在有或没有惩罚基准过程的情况下对 SWA 的实用附加策略,以进一步确保“真”发现的机会。我们将 SWA 应用于来自 Broad Institute 的卵巢浆液性囊腺癌标本,揭示了功能上重要的基因和通路,并通过额外的基因组学工具进行了验证。这一第二阶段研究在当前关于 P 值恰当使用的讨论中是必不可少的。
引用
@article{arxiv.2002.02903,
title = {Subsampling Winner Algorithm for Feature Selection in Large Regression Data},
author = {Yiying Fan and Jiayang Sun},
journal= {arXiv preprint arXiv:2002.02903},
year = {2020}
}