超高维特征下单指标风险率模型的独立筛选
机器学习
2011-08-12 v2
摘要
在特征数远多于观测数的数据集中,基于所有单变量回归模型的独立筛选导出了一种计算上非常便利的变量选择方法。近期的研究表明,在广义线性模型的情况下,即使在超高维度下,独立筛选也可能以高概率捕获所有相关特征,从而满足确定筛选性质。当响应变量为右删失生存时间时,这种形式上的确定筛选性质是否可达尚不清楚。我们提出了一种针对生存数据的计算效率极高的独立筛选方法,可视为相关性筛选在生存数据下的自然推广。我们给出了在超高维特征的一般单指标风险率模型类中,该方法满足确定筛选性质的条件。文中还描述了一种迭代变体,该变体将筛选与惩罚回归相结合,以处理更复杂的特征协方差结构。通过模拟研究以及对真实基因表达数据集的应用,对这些方法进行了评估。
引用
@article{arxiv.1105.3361,
title = {Independent screening for single-index hazard rate models with ultra-high dimensional features},
author = {Anders Gorst-Rasmussen and Thomas H. Scheike},
journal= {arXiv preprint arXiv:1105.3361},
year = {2011}
}
备注
32 pages, 3 figures