中文

通过分层 Lasso 进行分组变量选择及其 Oracle 性质

统计方法学 2010-08-10 v2

摘要

在许多工程和科学应用中,预测变量是分组的,例如在生物学应用中,被分析的基因或蛋白质可按生物学功能或生物学通路分组。常见的统计分析方法,如方差分析、因子分析和基于基函数集的函数建模,也表现出自然的变量分组。现有的成功分组变量选择方法,如 Antoniadis 和 Fan (2001)、Yuan 和 Lin (2006) 以及 Zhao、Rocha 和 Yu (2009),存在“全选全不选”的局限性,即当组内一个变量被选中时,同一组内的所有其他变量也被选中。然而,在许多实际问题中,例如在基因集选择中,我们可能希望保持组内变量选择的灵活性。在本文中,我们开发了一种新的分组变量选择方法,该方法不仅能有效移除不重要的组,还能保持组内变量选择的灵活性。我们还表明,新方法具有实现 Fan 和 Li (2001) 以及 Fan 和 Peng (2004) 中理论“oracle”性质的潜力。

关键词

引用

@article{arxiv.1006.2871,
  title  = {Group Variable Selection via a Hierarchical Lasso and Its Oracle Property},
  author = {Nengfeng Zhou and Ji Zhu},
  journal= {arXiv preprint arXiv:1006.2871},
  year   = {2010}
}

备注

43 pages, 2 figures