通过分层 Lasso 进行分组变量选择及其 Oracle 性质
统计方法学
2010-08-10 v2
摘要
在许多工程和科学应用中,预测变量是分组的,例如在生物学应用中,被分析的基因或蛋白质可按生物学功能或生物学通路分组。常见的统计分析方法,如方差分析、因子分析和基于基函数集的函数建模,也表现出自然的变量分组。现有的成功分组变量选择方法,如 Antoniadis 和 Fan (2001)、Yuan 和 Lin (2006) 以及 Zhao、Rocha 和 Yu (2009),存在“全选全不选”的局限性,即当组内一个变量被选中时,同一组内的所有其他变量也被选中。然而,在许多实际问题中,例如在基因集选择中,我们可能希望保持组内变量选择的灵活性。在本文中,我们开发了一种新的分组变量选择方法,该方法不仅能有效移除不重要的组,还能保持组内变量选择的灵活性。我们还表明,新方法具有实现 Fan 和 Li (2001) 以及 Fan 和 Peng (2004) 中理论“oracle”性质的潜力。
引用
@article{arxiv.1006.2871,
title = {Group Variable Selection via a Hierarchical Lasso and Its Oracle Property},
author = {Nengfeng Zhou and Ji Zhu},
journal= {arXiv preprint arXiv:1006.2871},
year = {2010}
}
备注
43 pages, 2 figures